Questões de Concurso
Sobre etl (extract transform load) em banco de dados
Foram encontradas 224 questões
Clericuzi et al. (2006), citados por Pedroso et al. (2024), destacam que as tecnologias de Inteligência de Negócios (Business Intelligence) necessitam de componentes robustos para garantir a coleta, processamento e análise eficazes dos dados empresariais.
A tecnologia que NÃO está ligada diretamente ao BI é:
I- Em processos de ETL, a etapa de transformação pode envolver padronização de formatos, tratamento de valores ausentes, remoção de duplicações, conversão de tipos, aplicação de regras de negócio e conformidade entre dimensões oriundas de fontes distintas.
II- A qualidade dos dados em ambientes analíticos depende exclusivamente da ferramenta de visualização utilizada, pois inconsistências de origem, duplicidades, ausência de chaves de integração e divergências semânticas são corrigidas automaticamente durante a renderização dos dashboards.
III- Técnicas de Data Mining podem ser utilizadas para identificar padrões, associações, agrupamentos, classificações ou tendências em grandes conjuntos de dados, mas seus resultados exigem interpretação crítica, validação e atenção a vieses, qualidade da amostra e pertinência do modelo.
IV- A carga incremental em um Data Warehouse elimina a necessidade de controle temporal dos dados, pois qualquer alteração em sistemas de origem deve sobrescrever integralmente os registros históricos para preservar apenas o estado atual das informações.
Analisadas as sentenças, estão CORRETAS apenas:
• Abordagem 1
− Extrair dados dos sistemas de cada posto (CSV, Excel, bancos locais)
− Transformar os dados em um servidor intermediário: padronizar formatos de data, validar CPF, limpar dados inconsistentes, calcular métricas agregadas
− Carregar apenas os dados já processados e limpos no Data Warehouse
• Abordagem 2
− Extrair dados dos sistemas de cada posto
− Carregar os dados brutos diretamente no Data Lake (Amazon S3)
− Transformar os dados, quando necessário, usando ferramentas de análise (SQL, Python, Spark)
Sobre essas abordagens, é correto afirmar que:
Acerca do armazenamento de Big Data, do pipeline de dados e dos conceitos de data lake, julgue o item subsequente.
Em pipelines de dados, a etapa de ingestão corresponde ao processo de eliminação permanente dos dados de origem após o carregamento no ambiente analítico.
Acerca do armazenamento de Big Data, do pipeline de dados e dos conceitos de data lake, julgue o item subsequente.
Em pipelines de dados, a etapa de transformação pode incluir limpeza, padronização e enriquecimento dos dados processados.
Um analista de dados de uma agência reguladora está desenvolvendo um painel para monitorar indicadores de desempenho do setor. Ele está utilizando uma ferramenta de BI que envolve um processo de ETL (Extração, Transformação e Carga) para preparar os dados.
Analise as seguintes proposições sobre as etapas do processo de BI:
I. Extração (Extract): É a fase de coleta de dados de diversas fontes, que podem ser bancos de dados relacionais (SQL Server, Oracle), planilhas (Excel), arquivos de texto (CSV), serviços web (APIs), entre outros.
II. Transformação (Transform): Nesta fase, os dados extraídos são limpos, padronizados, combinados e modelados. Podem ser realizadas operações como remoção de duplicatas, cálculo de novas colunas e criação de hierarquias para preparar os dados para a análise.
III. Carga (Load): Após a transformação, os dados são carregados no modelo de dados da ferramenta de BI (como o Power BI ou Qlik Sense), onde ficarão disponíveis para a criação de relatórios e dashboards interativos.
Está correto o que se afirma em:
I. A análise de cardinalidade em uma coluna consiste em identificar o número de valores distintos presentes, sendo útil para reconhecer possíveis chaves candidatas e detectar colunas com baixa variabilidade que podem indicar problemas de qualidade.
II. O profiling de nulidade verifica a proporção de valores ausentes em cada coluna, fornecendo informações relevantes para decisões sobre estratégias de tratamento, como imputação, exclusão de registros ou criação de indicadores de ausência.
III. A análise de distribuição de frequência permite identificar quais valores ocorrem com maior regularidade em uma coluna e é aplicável exclusivamente a colunas com tipos de dados numéricos, não sendo útil para colunas do tipo texto ou categórico.
IV. O profiling básico, por ser uma análise estática realizada antes da ingestão, elimina a necessidade de validações de qualidade posteriores durante as fases de transformação e carga, desde que o dataset analisado não sofra alterações estruturais.
Estão CORRETAS:
O formato CSV é amplamente utilizado em pipelines de dados para transferência de conjuntos de dados entre sistemas heterogêneos. Apesar de sua simplicidade, o formato apresenta características e limitações técnicas que devem ser consideradas durante a implementação de processos de ingestão e integração. Diante disso, analise as afirmativas a seguir sobre o formato CSV:
II. Um arquivo CSV suporta a representação nativa de dados hierárquicos e aninhados, como listas de itens vinculados a um único registro pai, desde que os delimitadores aninhados sejam configurados corretamente no parser utilizado.
III. Quando um valor de campo contém o caractere delimitador, esse campo deve ser envolvido entre aspas duplas para que o parser o interprete como um único valor, conforme previsto pela especificação RFC 4180.
IV. A codificação de caracteres utilizada em um arquivo CSV é declarada de forma explícita no próprio arquivo, garantindo que sistemas distintos realizem a leitura correta dos dados sem necessidade de configuração adicional.
Está(ão) CORRETA(S):
No contexto de Business Intelligence (BI), o desenvolvimento de Datamarts e a execução de processos de ETL (Extract, Transform, Load) são fundamentais para organizar, integrar e disponibilizar informações de forma eficiente para análise gerencial. Com base nesses conceitos, analise as assertivas a seguir sobre Datamarts e ETL e julgue-as em Verdadeiras (V) ou Falsas (F):
( ) Uma estrutura de Datamarts é do tipo Snowflake Schema, na qual a estrutura de dimensões é desnormalizada (tudo em uma tabela).
( ) No ETL, especificamente na etapa de Load, um dos tipos de carregamento é full load, em que todos os dados existentes são substituídos pelo novo conjunto.
( ) No ETL, especificamente na etapa de Transform, uma atividade pode ser de derivação, por exemplo, criar campos novos a partir de existentes (ex.: lucro = receita - custo).
Qual alternativa preenche, CORRETAMENTE, de cima para baixo, os parênteses acima?