Questões de Concurso
Sobre etl (extract transform load) em banco de dados
Foram encontradas 247 questões
A análise exigirá a coleta periódica dos registros, a seleção de campos específicos e sua integração com dados provenientes de outras fontes. O procedimento deverá ser automatizado e suportar variações na quantidade de registros disponibilizados a cada período.
Nesse contexto, a utilização prioritária da forma III justifica-se porque o formato JSON
Segundo Ramakrishnan (2008), quais os processos de criação e manutenção de um ambiente de Data Warehouse?
• cada id_pagamento deve aparecer apenas uma vez;
• o campo valor deve estar preenchido e conter número maior que zero;
• após o tratamento dos dados, os registros válidos devem ser agrupados segundo a proximidade entre seus valores.
Para realizar o procedimento, foi elaborado o seguinte código em Python, que implementa uma forma simplificada de agrupamento por centroides:
A respeito da execução do código e das etapas de qualidade e mineração de dados, assinale a afirmativa correta.
Para apoiar as atividades de fiscalização, a equipe pretende
I. tratar esse cenário de grande volume, variedade de fontes e produção contínua de dados;
II. manter os dados recebidos em um repositório que permita armazená-los em seus formatos originais, antes de tratamentos destinados a análises específicas;
III. executar um processo que obtenha os dados das fontes, realize as transformações necessárias e os carregue no ambiente definido para utilização.
Os conceitos que correspondem às situações I, II e III são, respectivamente,
Os três primeiros valores possuem a mesma sequência numérica após a retirada dos caracteres de formatação. O quarto também pode ser expresso como uma sequência de 14 algarismos, mas possui dígitos verificadores inválidos.
O processamento deve permitir o cruzamento dos CNPJs válidos, sem impedir a conferência posterior dos valores efetivamente recebidos de cada órgão.
Nesse caso, os dados devem ser tratados de modo a
Assinale a alternativa que apresenta uma abordagem tecnicamente adequada para reduzir inconsistências decorrentes da integração de dados heterogêneos.
Durante a construção de um painel institucional sobre desempenho legislativo, uma equipe de análise de dados consolidou informações provenientes de sistemas de tramitação, registros de votação, indicadores orçamentários e bases administrativas. Na etapa de preparação dos dados, foram identificados campos sem preenchimento em determinadas variáveis, registros contendo valores excepcionalmente distantes do comportamento predominante da base e diferentes padrões de preenchimento para atributos equivalentes oriundos de sistemas distintos. Como a qualidade dos resultados analíticos dependia diretamente da confiabilidade dos dados processados, tornou-se necessário aplicar procedimentos adequados de pré-processamento.
Assinale a alternativa que apresenta uma associação tecnicamente correta entre os problemas identificados e as respectivas ações de tratamento.
Assinale a alternativa que apresenta um conjunto de fontes compatível com esse objetivo.
Assinale a alternativa que apresenta uma abordagem tecnicamente adequada para promover a interoperabilidade em ambientes compostos por fontes heterogêneas de dados.
Assinale a alternativa que apresenta a descrição tecnicamente adequada do processo utilizado nesse cenário.
Assinale a alternativa que apresenta, de forma tecnicamente adequada, a relação entre as dimensões de qualidade de dados afetadas e as medidas de tratamento compatíveis com esse cenário.
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
No modelo ELT (extract, load, transform), a carga dos dados no repositório ocorre antes da aplicação de transformações estruturais, permitindo que o ambiente de destino atue como motor de processamento e simplificando a arquitetura ao dispensar camadas de staging externas para a manipulação prévia dos dados.
A respeito de banco de dados, julgue o item seguinte.
O ETL (extract, transform, and load) é um processo de integração de dados que tem alto custo computacional.
Para isso, foi usada a seguinte configuração de filtro:
Com base no funcionamento do Logstash e dos plugins utilizados, com a específica configuração e sintaxe apresentadas, assinale a afirmativa correta.
Ao receber a planilha bruta, percebeu que havia campos em branco, inconsistências de formatação e valores duplicados. Nesse contexto, assinale a opção que indica a ferramenta mais adequada para realizar a extração e a limpeza desses dados, antes da análise.
Sobre o ETL, assinale a afirmativa correta.