Questões de Concurso
Sobre big data em banco de dados
Foram encontradas 402 questões
Julgue o próximo item, a respeito de computação e de programação.
A análise de Big Data lida com dados estruturados, como tabelas e bancos de dados relacionais, mas não considera dados não estruturados, como textos, imagens e vídeos.
Julgue o item subsequente, a respeito de sensoriamento remoto e de sistemas de informação geográfica.
O uso de plataformas de Big Data em agricultura dispensa algoritmos de aprendizado de máquina, pois a análise estatística tradicional é suficiente para gerar resultados úteis.
I. Processa dados em true real-time, lidando com cada evento assim que ele chega.
II. O modo de micro-batch introduz um pequeno delay (latência) entre a ingestão e o processamento dos dados devido à coleta em lote.
III. Mostra um fluxo mais continuo de resultados, especialmente se nenhum windowing ou batching estiver envolvido.
IV. Mais adequado para pipelines de ETL e análises de logs, nos quais a latência dos micro-batching é aceitável.
V. O modelo de processamento de fluxo real garante semântica exactly-once para o processamento de eventos, o que é essencial para aplicações críticas.
As características estão corretamente atribuídas às ferramentas em:
Em relação ao data warehouse, ao data lake e ao tratamento de dados, julgue o item seguinte.
A camada de ingestão de dados é responsável por coletar e carregar dados de diversas fontes para o data lake.
A principal característica de um data lake é sua capacidade de armazenar diferentes tipos de dados (estruturados, semiestruturados e não estruturados) sem a necessidade de um esquema antecipadamente definido.
Em relação ao tema, relacione os conceitos a seguir às suas respectivas aplicações.
1. Volume.
2. Variedade.
3. Velocidade.
4. Veracidade.
( ) Os sistemas gerenciadores de bancos de dados relacionais foram projetados e otimizados para funcionar em dados estruturados. Em aplicações de Big Data isto não é mandatório, os demais tipos de dados também têm de ser geridos e processados. Além dos estruturados, os dados podem incluir imagens, texto, áudio e vídeo. Aproximadamente 90% dos dados gerados atualmente são não estruturados. Os sistemas de Big Data precisam ser capazes de gerenciar e processar todos esses tipos de dados perfeitamente.
( ) Os dados usados em aplicações de Big Data vêm de muitas fontes, cada uma pode ter estruturas distintas e não ser totalmente confiáveis, podem haver erros, ruídos, inconsistências, desinformações deliberadas entre outros. São comumente referidos como “dados sujos”, alega-se que dados sujos custam bilhões dólares por ano e os sistemas de Big Data precisam “limpar” os dados e manter sua proveniência para justificar sua confiabilidade.
( ) Os conjuntos de dados usados nas aplicações de Big Data são massivos, normalmente na faixa de petabytes, com o rápido crescimento da Internet as aplicações em breve atingirão zettabytes. Para colocar isso em perspectiva, em 2016, o Google informou que os uploads de usuários para o YouTube exigiram 1 petabytes de nova capacidade de armazenamento por dia. Em 2018, o Facebook armazenava cerca de 250 bilhões de imagens exigindo exabytes de armazenamento.
( ) Um aspecto importante das aplicações de Big Data é que elas precisam lidar com dados que chegam ao sistema sob a forma fluxos em tempo real, exigindo que sejam capazes de processar os dados à medida que eles chegam. O Facebook processa mais de 900 milhões de fotos que os usuários carregam por dia. O Alibaba informou que durante um recente período de pico tiveram que processar 470 milhões registros de eventos por segundo. Sistemas desse tipo não permitem que os dados sejam armazenados antes do processamento.
A relação correta, na ordem apresentada, é:
A respeito de transformação digital, julgue o item a seguir.
As políticas públicas para a transformação digital dirigem-se preferencialmente a empresas de médio e grande porte, em razão de sua maior capacidade de investimento.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
A transformação de dados categóricos utilizando codificação one-hot sempre reduz a dimensionalidade do conjunto de dados.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
A normalização dos dados é importante na preparação de dados para modelos de aprendizado de máquina, pois garante que todas as variáveis estejam na mesma escala, independentemente de sua importância no modelo.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
Local outlier factor é uma técnica de detecção de outliers que mede a anomalia de um dado com base na densidade local dos seus vizinhos.