Questões de Concurso
Sobre data mining em banco de dados
Foram encontradas 572 questões
I- Em processos de ETL, a etapa de transformação pode envolver padronização de formatos, tratamento de valores ausentes, remoção de duplicações, conversão de tipos, aplicação de regras de negócio e conformidade entre dimensões oriundas de fontes distintas.
II- A qualidade dos dados em ambientes analíticos depende exclusivamente da ferramenta de visualização utilizada, pois inconsistências de origem, duplicidades, ausência de chaves de integração e divergências semânticas são corrigidas automaticamente durante a renderização dos dashboards.
III- Técnicas de Data Mining podem ser utilizadas para identificar padrões, associações, agrupamentos, classificações ou tendências em grandes conjuntos de dados, mas seus resultados exigem interpretação crítica, validação e atenção a vieses, qualidade da amostra e pertinência do modelo.
IV- A carga incremental em um Data Warehouse elimina a necessidade de controle temporal dos dados, pois qualquer alteração em sistemas de origem deve sobrescrever integralmente os registros históricos para preservar apenas o estado atual das informações.
Analisadas as sentenças, estão CORRETAS apenas:
A principal diferença conceitual entre essas duas abordagens reside no fato de que, no aprendizado supervisionado:
( ) Classificação é uma técnica não supervisionada cujo objetivo é prever uma classe categórica a partir dos dados analisados.
( ) Regressão é uma técnica supervisionada utilizada para prever um valor numérico contínuo com base em um conjunto de dados previamente rotulados.
( ) Clusterização é uma técnica não supervisionada que visa agrupar objetos similares sem a utilização de rótulos prévios.
( ) Regras de associação buscam identificar relações do tipo “Se X ocorre, então Y tende a ocorrer”, sendo o algoritmo k-NN (k-Nearest Neighbors, ou k-vizinhos mais próximos) um dos métodos comumente utilizados para esse fim.
Julgue o próximo item, a respeito de visualização e análise exploratória de dados, de linguagens e ferramentas de apoio à análise de dados e de técnicas e tarefas de mineração de dados.
O boxplot (diagrama de caixa) é uma ferramenta de visualização que possibilita identificar a mediana, a dispersão dos dados e a presença de valores atípicos (outliers) em uma distribuição.
Acerca de modelagem dimensional, do CRISP-DM e do uso de banco de dados relacionais na análise de dados, julgue o item a seguir.
No modelo de referência CRISP-DM, a fase de preparação de dados ocorre estritamente após a conclusão da fase de modelagem, com o objetivo de formatar as saídas preditivas geradas.