Questões de Concurso
Sobre data mining em banco de dados
Foram encontradas 576 questões
Para reduzir o tempo de resposta, o sistema passou a analisar o histórico dos atendimentos, considerando, entre outros elementos:
• horário de entrada da demanda;
• texto apresentado pelo usuário;
• categoria registrada;
• unidade para a qual a demanda foi encaminhada; e
• orientação fornecida.
A análise dos horários permitiu identificar os períodos de maior procura e as variações no volume de atendimentos ao longo do dia. Verificou-se também que demandas apresentadas de formas distintas eram frequentemente solucionadas com a mesma orientação. Considere parte dos resultados:
Embora os padrões de horário e volume pudessem ser identificados, a organização da base dificultava relacionar diferentes formas de apresentação às mesmas necessidades e orientações.
A conclusão sobre essa limitação foi sustentada pelo fato de a análise ter identificado
• cada id_pagamento deve aparecer apenas uma vez;
• o campo valor deve estar preenchido e conter número maior que zero;
• após o tratamento dos dados, os registros válidos devem ser agrupados segundo a proximidade entre seus valores.
Para realizar o procedimento, foi elaborado o seguinte código em Python, que implementa uma forma simplificada de agrupamento por centroides:
A respeito da execução do código e das etapas de qualidade e mineração de dados, assinale a afirmativa correta.
Pretende-se empregar os próprios dados para selecionar uma parcela reduzida dos registros que mereça exame prioritário. O critério de seleção deverá considerar combinações pouco usuais entre os atributos, inclusive quando cada característica, observada isoladamente, for frequente. A seleção resultante servirá apenas para direcionar a análise dos auditores.
A técnica compatível com esse objetivo é
I- Em processos de ETL, a etapa de transformação pode envolver padronização de formatos, tratamento de valores ausentes, remoção de duplicações, conversão de tipos, aplicação de regras de negócio e conformidade entre dimensões oriundas de fontes distintas.
II- A qualidade dos dados em ambientes analíticos depende exclusivamente da ferramenta de visualização utilizada, pois inconsistências de origem, duplicidades, ausência de chaves de integração e divergências semânticas são corrigidas automaticamente durante a renderização dos dashboards.
III- Técnicas de Data Mining podem ser utilizadas para identificar padrões, associações, agrupamentos, classificações ou tendências em grandes conjuntos de dados, mas seus resultados exigem interpretação crítica, validação e atenção a vieses, qualidade da amostra e pertinência do modelo.
IV- A carga incremental em um Data Warehouse elimina a necessidade de controle temporal dos dados, pois qualquer alteração em sistemas de origem deve sobrescrever integralmente os registros históricos para preservar apenas o estado atual das informações.
Analisadas as sentenças, estão CORRETAS apenas:
( ) Classificação é uma técnica não supervisionada cujo objetivo é prever uma classe categórica a partir dos dados analisados.
( ) Regressão é uma técnica supervisionada utilizada para prever um valor numérico contínuo com base em um conjunto de dados previamente rotulados.
( ) Clusterização é uma técnica não supervisionada que visa agrupar objetos similares sem a utilização de rótulos prévios.
( ) Regras de associação buscam identificar relações do tipo “Se X ocorre, então Y tende a ocorrer”, sendo o algoritmo k-NN (k-Nearest Neighbors, ou k-vizinhos mais próximos) um dos métodos comumente utilizados para esse fim.
O uso de algoritmos de processamento de linguagem natural (PLN) permite converter dados não estruturados de prontuários médicos e diários oficiais em indicadores quantitativos monitoráveis.
Julgue o próximo item, a respeito de visualização e análise exploratória de dados, de linguagens e ferramentas de apoio à análise de dados e de técnicas e tarefas de mineração de dados.
O boxplot (diagrama de caixa) é uma ferramenta de visualização que possibilita identificar a mediana, a dispersão dos dados e a presença de valores atípicos (outliers) em uma distribuição.
Acerca de modelagem dimensional, do CRISP-DM e do uso de banco de dados relacionais na análise de dados, julgue o item a seguir.
No modelo de referência CRISP-DM, a fase de preparação de dados ocorre estritamente após a conclusão da fase de modelagem, com o objetivo de formatar as saídas preditivas geradas.