Questões de Concurso Comentadas sobre big data em banco de dados

Foram encontradas 358 questões

Q4240113 Banco de Dados
Uma equipe de dados de um Tribunal de Justiça está estruturando uma nova plataforma para consolidar informações provenientes de sistemas processuais, documentos digitais, registros de auditoria, arquivos de mídia e bases analíticas utilizadas pela área de gestão. Considerando os conceitos de Data Warehouse e Lakehouse, a arquitetura mais adequada para esse cenário caracterizase por
Alternativas
Q4223167 Banco de Dados
Uma grande empresa pública de saúde enfrenta dificuldades para gerenciar seus dados analíticos. O modelo tradicional de Data Warehouse centralizado focado em tabelas altamente estruturadas e relacionais tornou-se muito rígido. Por outro lado, a implantação subsequente de um Data Lake gerou caos, acumulando arquivos de texto desestruturados e logs sem metadados, transformando-se em um Data Swamp. Buscando unificar o melhor dos dois mundos, o Analista de Dados propôs migrar para uma arquitetura de Data Lakehouse.
A principal característica arquitetural que define o conceito de Data Lakehouse, diferenciando-o das abordagens tradicionais isoladas de Data Warehouse e Data Lake é a
Alternativas
Q4221496 Banco de Dados
É correto afirmar que Big Data
Alternativas
Q4209732 Banco de Dados
A arquitetura lakehouse surgiu como uma abordagem voltada à integração de características tradicionalmente presentes em data lakes e data warehouses, buscando combinar flexibilidade de armazenamento, escalabilidade analítica e mecanismos avançados de governança e consistência de dados. Considerando os conceitos fundamentais relacionados à arquitetura lakehouse, assinale a afirmativa correta.
Alternativas
Q4200148 Banco de Dados
Assinale a opção correta no que se refere a dados estruturados e não estruturados, bem como a coleta, tratamento, armazenamento, integração e recuperação de dados.
Alternativas
Q4185304 Banco de Dados
Sobre Big Data, considere as seguintes afirmações:

I – Big data é um conjunto de dados maior e mais complexo, especialmente de novas fontes de dados. Esses conjuntos de dados são tão volumosos que o software tradicional de processamento de dados normalmente não consegue gerenciá-los.
II – Velocidade é a taxa mais rápida na qual os dados são recebidos e talvez administrados. Normalmente, a velocidade mais alta dos dados é transmitida diretamente para a memória, em vez de ser gravada no disco.
III – Variedade refere-se aos vários tipos de dados disponíveis. Tipos de dados tradicionais foram estruturados e se adequam perfeitamente a um banco de dados relacional.
IV – As soluções de Big Data são feitas para lidar com um grande volume de dados estruturados que obrigatoriamente têm relação entre si.
V – Por conta do grande volume de dados e complexidade envolvidos, as soluções Big Data apresentam um grau relativamente baixo de confiabilidade.

Estão INCORRETAS as afirmações:
Alternativas
Q4181540 Banco de Dados
Uma instituição financeira está implementando um sistema de detecção de fraudes em tempo real para processar transações de cartões de crédito originadas em dispositivos móveis globalmente. Devido à instabilidade de conectividade das redes móveis, os eventos de transação frequentemente chegam ao cluster de processamento fora de ordem e com atrasos variáveis (late arriving data). O requisito de negócio exige que as agregações de volume financeiro sejam calculadas com precisão determinística, baseando-se no momento exato em que a compra ocorreu, e não no momento em que o dado foi recebido pelo servidor, garantindo consistência mesmo em casos de reprocessamento histórico.

Considerando os conceitos de processamento de fluxo contínuo (streaming), semântica de tempo e mecanismos de tratamento de dados atrasados, é correto afirmar que: 
Alternativas
Q4181535 Banco de Dados
Uma corporação multinacional do setor de varejo está unificando suas plataformas de dados. O cenário atual apresenta dois desafios distintos, indicados a seguir.

• Transacional e BI: o sistema de vendas gera registros financeiros que exigem consistência estrita (ACID). A equipe de analistas de negócios consome esses dados via painéis de BI que demandam baixa latência em consultas complexas com múltiplas junções (joins).
• Big Data e IA: o sistema de e-commerce gera petabytes de logs de navegação (clickstream) e dados de sensores IoT das lojas físicas (dados semiestruturados). A equipe de ciência de dados precisa acessar esses dados em seu formato bruto para treinar modelos preditivos, sem a perda de informações causada por agregações prematuras.

O arquiteto de dados precisa propor uma solução única que evite a duplicação de dados entre silos (um Data Warehouse para o BI e um Data Lake para a IA) e reduza o custo de armazenamento, mantendo a governança.

Considerando os requisitos apresentados e as características das arquiteturas modernas de dados, a abordagem arquitetural e de modelagem adequada é:
Alternativas
Ano: 2026 Banca: FGV Órgão: TJ-SC Prova: FGV - 2026 - TJ-SC - Analista de Sistemas |
Q4150987 Banco de Dados
Com relação às arquiteturas de armazenamento e processamento de dados em larga escala, analise as afirmativas a seguir e assinale (V) para verdadeira e (F) para falsa.

( ) Os Data Lakes fundamentam-se no conceito de schema-onread, permitindo o armazenamento de dados em seu formato bruto sem a necessidade de uma estrutura rígida no momento da ingestão.
( ) Os Data Warehouses operam sob o modelo de schema-onwrite, exigindo que os dados sejam transformados e estruturados conforme um esquema definido antes de sua carga e disponibilização para consulta.
( ) Os Data Lakes são repositórios projetados exclusivamente para o armazenamento de dados não estruturados, sendo tecnicamente incompatíveis para dados estruturados provenientes de sistemas transacionais.

As afirmativas são, respectivamente,
Alternativas
Q4088614 Banco de Dados
Um pipeline de dados do TCE-SC processa bilhões de registros de notas fiscais usando Spark SQL. O Auditor nota um problema de desbalanceamento de dados no qual um único executor demora muito mais que os outros para completar uma operação de Join, pois uma chave específica possui muito mais registros que as demais.
A seguinte técnica avançada de otimização no Spark 3.x permite ao motor de execução identificar esse desequilíbrio em tempo de execução e dividir a partição sobrecarregada em subtarefas menores: 
Alternativas
Q4088600 Banco de Dados
Para processar terabytes de logs de notas fiscais eletrônicas, o TCE-SC utiliza um cluster Apache Spark. O Auditor nota que o processamento está lento devido ao excesso de movimentação de dados entre os nós da rede durante operações de agrupamento.
A operação do Spark conhecida por causar esse fenômeno de Shuffle e que deve ser utilizada com cautela em grandes datasets é:
Alternativas
Q4067460 Banco de Dados
Observando um órgão estadual que integra NF-e, EFD/SPED, logs de sistemas, dados semiestruturados de convênios e arquivos em múltiplos formatos, preservando os dados no formato original para usos analíticos futuros, a característica arquitetural que define um data lake no cenário descrito é
Alternativas
Q4048568 Banco de Dados

O Portal da Transparência do Governo Federal precisa lidar com um volume massivo e crescente de dados heterogêneos, como despesas, receitas, contratos e informações sobre servidores. A arquitetura de dados atual, baseada em um modelo puramente relacional, enfrenta desafios de desempenho e flexibilidade para incorporar novas fontes de dados.


Analise as seguintes proposições sobre a aplicação de bancos de dados NoSQL para solucionar os desafios do Portal da Transparência: 


I. Bancos de dados relacionais são inerentemente superiores aos NoSQL para cenários de Big Data e dados heterogêneos, pois a rigidez do esquema e o suporte a transações ACID garantem melhor desempenho em consultas analíticas complexas.


 II. A adoção de um banco de dados NoSQL orientado a documentos permitiria armazenar os dados de cada fonte (despesas, contratos, etc.) em seus formatos originais (JSON, por exemplo), facilitando a ingestão e a evolução do modelo de dados sem a necessidade de migrações de esquema complexas.


III. A escalabilidade horizontal, uma característica comum em muitos SGBDs NoSQL, seria um benefício chave, permitindo que a infraestrutura do portal cresça de forma mais elástica e com menor custo para acompanhar o aumento do volume de dados e do número de acessos.


Está correto o que se afirma em:

Alternativas
Q4048561 Banco de Dados

Para lidar com o grande volume e a complexidade dos dados do Big Data, foram desenvolvidas tecnologias e frameworks específicos, que superam as limitações dos sistemas de bancos de dados tradicionais. Um analista de dados de um órgão de pesquisa precisa processar um grande conjunto de dados não estruturados.


Analise as seguintes proposições sobre as tecnologias de Big Data:


I. O Hadoop é um framework de código aberto que permite o processamento distribuído de grandes conjuntos de dados em clusters de computadores. Seus componentes principais são o HDFS (Hadoop Distributed File System), para armazenamento distribuído, e o MapReduce, para o processamento paralelo.

II. O MapReduce é um modelo de programação onde a tarefa é dividida em duas fases: a fase 'Map', que processa e mapeia os dados de entrada em pares de chave-valor, e a fase 'Reduce', que agrega os resultados intermediários da fase 'Map' para produzir o resultado final.

III. O Spark é outro framework de processamento distribuído que, embora compatível com o ecossistema Hadoop, é conhecido por ser significativamente mais rápido, pois realiza o processamento em memória (in-memory), sendo ideal para aplicações de aprendizado de máquina e processamento de dados em tempo real.


Está correto o que se afirma em: 

Alternativas
Q4036220 Banco de Dados
Um Analista de Sistemas, que atua em uma agência de fomento vinculada ao setor governamental, está trabalhando com o Hadoop para processar e analisar grandes volumes de dados armazenados no HDFS (Hadoop Distributed File System). Ele precisa consultar esses dados de forma rápida e eficiente, utilizando uma linguagem semelhante ao SQL (Structured Query Language) para extrair informações agregadas e gerar relatórios. Considerando esse contexto, assinale a alternativa que apresenta duas ferramentas do Hadoop capazes de consultar grandes volumes de dados no HDFS, usando uma linguagem semelhante ao SQL (HiveQL/SQL):
Alternativas
Q3991692 Banco de Dados
A respeito do Snowflake para gestão de grandes volumes de dados, analise as assertivas e assinale a alternativa que aponta as corretas.
I. O Snowflake processa consultas usando clusters de computação MPP.
II. Cada warehouse virtual é um cluster de computação independente que não compartilha recursos computacionais com outros warehouses virtuais.
III. A autenticação é um serviço que é gerenciado dentro da camada de serviços de nuvem.
IV. A arquitetura do Snowflake consiste em três camadas principais, sendo elas: armazenamento de banco de dados; dimensionamento de consultas e serviços de nuvem. 
Alternativas
Q3991683 Banco de Dados
Qual é o sistema de gerenciamento de banco de dados de mapas classificados multidimensionais, persistentes, distribuídos e esparsos, o qual é construído sobre um DFS (Distributed File System), podendo armazenar arquivos de grande porte? 
Alternativas
Q3986716 Banco de Dados
Um analista de tecnologia de informação da Prefeitura de Joinville está desenvolvendo um sistema de análise de grandes volumes de dados sobre serviços públicos, incluindo estatísticas de atendimento e indicadores de desempenho ao longo do tempo. Para otimizar consultas analíticas e agregações rápidas por colunas, ele precisa de um banco de dados NoSQL cujo modelo principal seja colunar, mesmo que ele também ofereça suporte a outros tipos de dados. Qual banco de dados atende a essa necessidade?
Alternativas
Q3973797 Banco de Dados
No contexto de arquiteturas modernas de dados, data lakes são adotados para lidar com grande volume, variedade e velocidade de dados, mantendo flexibilidade para múltiplos usos analíticos, tendo como princípio a estratégia
Alternativas
Q3968385 Banco de Dados
Em um pipeline de dados, o modelo ETL (Extract, Transform, Load) caracteriza-se pela realização das transformações antes da carga dos dados no sistema de destino, enquanto o modelo ELT (Extract, Load, Transform) adia as transformações para depois da ingestão dos dados em um ambiente analítico. Nesse contexto, a alternativa mais coerente com os impactos em escalabilidade, custo computacional e planejamento em cenários de big data é: 
Alternativas
Respostas
1: D
2: A
3: D
4: D
5: A
6: C
7: B
8: E
9: A
10: B
11: C
12: C
13: D
14: C
15: A
16: C
17: B
18: E
19: D
20: A