Questões de Concurso
Sobre etl (extract transform load) em banco de dados
Foram encontradas 234 questões
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
No modelo ELT (extract, load, transform), a carga dos dados no repositório ocorre antes da aplicação de transformações estruturais, permitindo que o ambiente de destino atue como motor de processamento e simplificando a arquitetura ao dispensar camadas de staging externas para a manipulação prévia dos dados.
A respeito de banco de dados, julgue o item seguinte.
O ETL (extract, transform, and load) é um processo de integração de dados que tem alto custo computacional.
Para isso, foi usada a seguinte configuração de filtro:
Com base no funcionamento do Logstash e dos plugins utilizados, com a específica configuração e sintaxe apresentadas, assinale a afirmativa correta.
Ao receber a planilha bruta, percebeu que havia campos em branco, inconsistências de formatação e valores duplicados. Nesse contexto, assinale a opção que indica a ferramenta mais adequada para realizar a extração e a limpeza desses dados, antes da análise.
Sobre o ETL, assinale a afirmativa correta.
Clericuzi et al. (2006), citados por Pedroso et al. (2024), destacam que as tecnologias de Inteligência de Negócios (Business Intelligence) necessitam de componentes robustos para garantir a coleta, processamento e análise eficazes dos dados empresariais.
A tecnologia que NÃO está ligada diretamente ao BI é:
I- Em processos de ETL, a etapa de transformação pode envolver padronização de formatos, tratamento de valores ausentes, remoção de duplicações, conversão de tipos, aplicação de regras de negócio e conformidade entre dimensões oriundas de fontes distintas.
II- A qualidade dos dados em ambientes analíticos depende exclusivamente da ferramenta de visualização utilizada, pois inconsistências de origem, duplicidades, ausência de chaves de integração e divergências semânticas são corrigidas automaticamente durante a renderização dos dashboards.
III- Técnicas de Data Mining podem ser utilizadas para identificar padrões, associações, agrupamentos, classificações ou tendências em grandes conjuntos de dados, mas seus resultados exigem interpretação crítica, validação e atenção a vieses, qualidade da amostra e pertinência do modelo.
IV- A carga incremental em um Data Warehouse elimina a necessidade de controle temporal dos dados, pois qualquer alteração em sistemas de origem deve sobrescrever integralmente os registros históricos para preservar apenas o estado atual das informações.
Analisadas as sentenças, estão CORRETAS apenas:
• Abordagem 1
− Extrair dados dos sistemas de cada posto (CSV, Excel, bancos locais)
− Transformar os dados em um servidor intermediário: padronizar formatos de data, validar CPF, limpar dados inconsistentes, calcular métricas agregadas
− Carregar apenas os dados já processados e limpos no Data Warehouse
• Abordagem 2
− Extrair dados dos sistemas de cada posto
− Carregar os dados brutos diretamente no Data Lake (Amazon S3)
− Transformar os dados, quando necessário, usando ferramentas de análise (SQL, Python, Spark)
Sobre essas abordagens, é correto afirmar que:
Acerca do armazenamento de Big Data, do pipeline de dados e dos conceitos de data lake, julgue o item subsequente.
Em pipelines de dados, a etapa de ingestão corresponde ao processo de eliminação permanente dos dados de origem após o carregamento no ambiente analítico.