Questões de Concurso
Comentadas sobre big data em banco de dados
Foram encontradas 358 questões
Em relação ao tema, relacione os conceitos a seguir às suas respectivas aplicações.
1. Volume.
2. Variedade.
3. Velocidade.
4. Veracidade.
( ) Os sistemas gerenciadores de bancos de dados relacionais foram projetados e otimizados para funcionar em dados estruturados. Em aplicações de Big Data isto não é mandatório, os demais tipos de dados também têm de ser geridos e processados. Além dos estruturados, os dados podem incluir imagens, texto, áudio e vídeo. Aproximadamente 90% dos dados gerados atualmente são não estruturados. Os sistemas de Big Data precisam ser capazes de gerenciar e processar todos esses tipos de dados perfeitamente.
( ) Os dados usados em aplicações de Big Data vêm de muitas fontes, cada uma pode ter estruturas distintas e não ser totalmente confiáveis, podem haver erros, ruídos, inconsistências, desinformações deliberadas entre outros. São comumente referidos como “dados sujos”, alega-se que dados sujos custam bilhões dólares por ano e os sistemas de Big Data precisam “limpar” os dados e manter sua proveniência para justificar sua confiabilidade.
( ) Os conjuntos de dados usados nas aplicações de Big Data são massivos, normalmente na faixa de petabytes, com o rápido crescimento da Internet as aplicações em breve atingirão zettabytes. Para colocar isso em perspectiva, em 2016, o Google informou que os uploads de usuários para o YouTube exigiram 1 petabytes de nova capacidade de armazenamento por dia. Em 2018, o Facebook armazenava cerca de 250 bilhões de imagens exigindo exabytes de armazenamento.
( ) Um aspecto importante das aplicações de Big Data é que elas precisam lidar com dados que chegam ao sistema sob a forma fluxos em tempo real, exigindo que sejam capazes de processar os dados à medida que eles chegam. O Facebook processa mais de 900 milhões de fotos que os usuários carregam por dia. O Alibaba informou que durante um recente período de pico tiveram que processar 470 milhões registros de eventos por segundo. Sistemas desse tipo não permitem que os dados sejam armazenados antes do processamento.
A relação correta, na ordem apresentada, é:
A respeito de transformação digital, julgue o item a seguir.
As políticas públicas para a transformação digital dirigem-se preferencialmente a empresas de médio e grande porte, em razão de sua maior capacidade de investimento.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
A transformação de dados categóricos utilizando codificação one-hot sempre reduz a dimensionalidade do conjunto de dados.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
A normalização dos dados é importante na preparação de dados para modelos de aprendizado de máquina, pois garante que todas as variáveis estejam na mesma escala, independentemente de sua importância no modelo.
Em relação a manipulação e limpeza de dados, julgue o item a seguir.
Local outlier factor é uma técnica de detecção de outliers que mede a anomalia de um dado com base na densidade local dos seus vizinhos.
Julgue o próximo item, a respeito de machine leaning.
Árvores de decisão são técnicas de modelagem preditiva que particionam iterativamente os dados em subconjuntos homogêneos baseados em variáveis explicativas.
Julgue o próximo item, a respeito de machine leaning.
Os algoritmos de regressão linear, por minimizarem a soma dos resíduos quadrados para ajustar os coeficientes, são sensíveis a outliers, que podem distorcer os coeficientes e comprometer a previsão do modelo.
Julgue o próximo item, a respeito de machine leaning.
Grandes volumes de dados frequentemente revelam padrões e tendências que são valiosos para análises preditivas e tomadas de decisão, facilitando a antecipação de comportamentos futuros e permitindo melhor alocação de recursos e planejamento.
Assinale a opção que melhor define o conceito de veracidade.
I. Enquanto dados não estruturados são normalmente armazenados em seu formato nativo (como vídeos, imagens ou documentos de texto), dados estruturados são armazenados em linhas e colunas e podem ser mapeados para campos predefinidos.
II. Ao contrário dos dados estruturados, que podem ser organizados e acessados por meio de bancos de dados relacionais, dados não estruturados não têm um modelo rígido de organização predefinido.
III. Conjuntos de dados semiestruturados usam tags e marcadores (ou seja, metadados) em vez de exigir um esquema predefinido em tabelas, linhas e colunas, como nos dados estruturados.
IV. Os data lakes podem ser projetados para armazenar dados semiestruturados juntamente com dados estruturados, permitindo a coexistência de dados de ambos os tipos.
Está correto o que se afirma em
1. Apache Kafka. 2. Apache Sqoop.
( ) Muito usado para transferência de dados entre bancos relacionais para o ecossistema Hadoop.
( ) Suas transferências de dados são baseadas em lotes, focando em transferências programadas ou sob demanda.
( ) Muito usado para streaming de dados em tempo real.
( ) Trabalha com mensageria distribuída, baseada no conceito de tópicos, permite que produtores enviem mensagens e consumidores as processem de forma assíncrona.
A associação correta, na ordem apresentada, é
Assinale a opção que apresenta, respectivamente, uma ferramenta que trata do modelo de dados orientado a colunas e outra, do modelo orientado a documentos.
Sobre os 5Vs que caracterizam o Big Data, assinale a afirmativa correta.
Esses modelos são classificados de acordo com a estrutura em que os dados são armazenados.
Um deles, especificamente, não considera conceitos como normalização de dados, criação de joins e definição de esquemas rígidos. Ele armazena estruturas flexíveis que podem ser obtidas por meio de dados semiestruturados, como os formatos XML e JSON. Cada uma dessas estruturas armazenadas não contém necessariamente os mesmos atributos, pois não é necessário definir um esquema.
O modelo em questão é o