Questões de Concurso
Sobre big data em banco de dados
Foram encontradas 402 questões
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
A adoção do conceito de schema-on-read em ambientes de Big Data pressupõe que os dados sejam persistidos em seu formato original, sem a validação rígida de esquemas no momento da ingestão, sendo essa uma abordagem na qual a estrutura e a semântica dos dados são aplicadas apenas no momento da leitura, o que oferece maior flexibilidade para lidar com dados não estruturados.
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
No modelo ELT (extract, load, transform), a carga dos dados no repositório ocorre antes da aplicação de transformações estruturais, permitindo que o ambiente de destino atue como motor de processamento e simplificando a arquitetura ao dispensar camadas de staging externas para a manipulação prévia dos dados.
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
Em ambientes de Big Data, os metadados técnicos (como esquemas e tipos de dados) são insuficientes para garantir a correta utilização das informações por usuários de negócio, sendo necessária, para a governança eficaz, a integração de metadados de negócio, como glossários e definições de domínio, para conferir contexto e significado aos dados armazenados.
Considere que uma secretaria esteja planejando implementar uma plataforma de Big Data para integrar sistemas transacionais e dados não estruturados em um data lake, visando promover análises históricas e em tempo real. A partir dessa situação hipotética e considerando as estratégias de administração de dados e os metadados, julgue o item a seguir.
A técnica de CDC (change data capture) baseada em logs permite identificar alterações no banco de dados de origem sem sobrecarregar as tabelas de produção com consultas constantes, abordagem que dispensa a inclusão de colunas de controle, como timestamps, nos esquemas originais dos sistemas de arrecadação.
A principal característica arquitetural que define o conceito de Data Lakehouse, diferenciando-o das abordagens tradicionais isoladas de Data Warehouse e Data Lake é a
I. O Hadoop MapReduce é um framework de software que facilita a criação de aplicações para processar vastas quantidades de dados (datasets de múltiplos terabytes) em paralelo, utilizando grandes clusters (milhares de nós) de hardware comum, de maneira confiável e tolerante a falhas.
II. O Hadoop Distributed File System (HDFS) é um sistema de arquivos distribuído, projetado para ser executado em hardware comum.
III. A ideia fundamental do YARN é dividir as funcionalidades de gerenciamento de recursos e o agendamento/monitoramento de tarefas em daemons distintos.
Está correto o que se afirma em
I – Big data é um conjunto de dados maior e mais complexo, especialmente de novas fontes de dados. Esses conjuntos de dados são tão volumosos que o software tradicional de processamento de dados normalmente não consegue gerenciá-los.
II – Velocidade é a taxa mais rápida na qual os dados são recebidos e talvez administrados. Normalmente, a velocidade mais alta dos dados é transmitida diretamente para a memória, em vez de ser gravada no disco.
III – Variedade refere-se aos vários tipos de dados disponíveis. Tipos de dados tradicionais foram estruturados e se adequam perfeitamente a um banco de dados relacional.
IV – As soluções de Big Data são feitas para lidar com um grande volume de dados estruturados que obrigatoriamente têm relação entre si.
V – Por conta do grande volume de dados e complexidade envolvidos, as soluções Big Data apresentam um grau relativamente baixo de confiabilidade.
Estão INCORRETAS as afirmações:
A INFRA S.A. passou a lidar com grandes volumes de dados heterogêneos oriundos de sensores de campo, relatórios de fiscalização, sistemas legados e bases externas. Para ampliar a capacidade analítica, a empresa pública adotou um ecossistema baseado em Apache Hadoop para armazenamento e processamento distribuído, integrando os dados consolidados a dashboards interativos desenvolvidos na ferramenta Qlik, voltados à alta gestão e a órgãos de controle. Com o objetivo de aprimorar a comunicação dos resultados analíticos, a INFRA S.A. também incorporou práticas de storytelling com dados, buscando transformar análises técnicas complexas em narrativas compreensíveis para gestores não técnicos, mantendo rigor informacional e rastreabilidade.
A partir da situação hipotética precedente, julgue os itens a seguir.
Considerando os conceitos de processamento de fluxo contínuo (streaming), semântica de tempo e mecanismos de tratamento de dados atrasados, é correto afirmar que:
• Transacional e BI: o sistema de vendas gera registros financeiros que exigem consistência estrita (ACID). A equipe de analistas de negócios consome esses dados via painéis de BI que demandam baixa latência em consultas complexas com múltiplas junções (joins).
• Big Data e IA: o sistema de e-commerce gera petabytes de logs de navegação (clickstream) e dados de sensores IoT das lojas físicas (dados semiestruturados). A equipe de ciência de dados precisa acessar esses dados em seu formato bruto para treinar modelos preditivos, sem a perda de informações causada por agregações prematuras.
O arquiteto de dados precisa propor uma solução única que evite a duplicação de dados entre silos (um Data Warehouse para o BI e um Data Lake para a IA) e reduza o custo de armazenamento, mantendo a governança.
Considerando os requisitos apresentados e as características das arquiteturas modernas de dados, a abordagem arquitetural e de modelagem adequada é:
Acerca do armazenamento de Big Data, do pipeline de dados e dos conceitos de data lake, julgue o item subsequente.
O armazenamento orientado a objetos é incompatível com data lakes devido à natureza dos dados armazenados.
Acerca do armazenamento de Big Data, do pipeline de dados e dos conceitos de data lake, julgue o item subsequente.
Em pipelines de dados, a etapa de ingestão corresponde ao processo de eliminação permanente dos dados de origem após o carregamento no ambiente analítico.