Questões de Concurso
Comentadas sobre data mining em banco de dados
Foram encontradas 532 questões
I. É um modelo de regressão linear e dentro do contexto do aprendizado de máquina, a regressão logística pertence à família de modelos de aprendizado de máquina supervisionado.
II. Representa dois grupos de interesse como uma variável binária com valores 0 e 1, não importando qual o grupo é designado com os valores o versus 1, mas a designação de como dever ser observada interpretação dos coeficientes.
III. A função logística é representada pelas seguintes fórmulas:
a) Logit(pi) = 1/(1+ ln(-pi))
b) exp(pi/(1-pi)) = β_0 + β _1*X_1 + … + β _k*K_k.
onde:
logit(pi) é a variável dependente ou de resposta, e x é a variável independente.
Está correto o que se afirma em
Baseando-se nessas informações, pode-se concluir que a etapa do KDD responsável pela limpeza, seleção e transformação dos dados antes da aplicação dos algoritmos é denominada:
Considerando os facilitadores característicos da análise de negócios preditiva, assinale a opção que apresenta um facilitador típico dessa abordagem.
Esses dois termos são conhecidos, respectivamente, como:
Assinale a alternativa que, respectivamente, corresponde a um algoritmo de associação e a uma métrica usada para validar a regra.
1. Anomalias não intencionais.
2. Anomalias pontuais.
3. Anomalias contextuais.
4. Anomalias coletivas.
( ) Essas anomalias, também conhecidas como valores discrepantes globais, são pontos de dados individuais que estão muito fora do restante do conjunto de dados. Um exemplo desses tipo anomalia é um saque de conta bancária que é significativamente maior do que qualquer um dos saques anteriores do usuário;
( ) Essas anomalias envolvem um conjunto de instâncias de dados que juntas se desviam da norma, mesmo que as instâncias individuais possam parecer normais. Um exemplo desse tipo de anomalia seria um conjunto de dados de tráfego de rede que mostra um aumento repentino no tráfego de vários endereços IP ao mesmo tempo;
( ) Essas anomalias são pontos de dados que se desviam da norma devido a erros ou ruído no processo de coleta de dados. Esses erros podem ser sistemáticos ou aleatórios, originados por problemas como sensores defeituosos ou erro humano durante a entrada de dados. Esse tipo de anomalia pode distorcer o conjunto de dados, dificultando a obtenção de insights precisos;
( ) Essas anomalias são pontos de dados que se desviam da norma dentro de um contexto específico. Essas anomalias não são necessariamente valores discrepantes quando consideradas isoladamente, mas se tornam anômalas quando vistas dentro de seu contexto específico. Por exemplo, considere o uso de energia. Se houver um aumento repentino no consumo de energia ao meio-dia, quando normalmente nenhum membro da família está em casa. Este dado pode não ser um valor discrepante quando comparado ao consumo de energia pela manhã ou à noite (quando as pessoas geralmente estão em casa), mas é anômalo em relação ao horário em que ocorreu.
A relação correta, na ordem dada, é:
• campos numéricos com valores negativos que não fazem sentido (como "idade" ou "renda");
• colunas categóricas com múltiplas grafias para a mesma categoria (ex: "PE", "pe", "Pernambuco");
• presença de valores nulos em campos-chave como “renda” e “número de dependentes”;
• valores repetidos na chave primária “ID cliente”.
Com base nas dimensões de qualidade de dados e nas boas práticas de tratamento com Python - especialmente usando Pandas -, é correto afirmar que a:
Sobre a mineração de dados, assinale a afirmativa correta.
Selecione a opção que identifica o método de particionamento de dados em que o “conjunto de treinamento” é gerado por N sorteios aleatórios com reposição a partir do conjunto de dados original (que contém N registros). Já o “conjunto de testes” é composto pelos registros não selecionados para o “conjunto de treinamento”.
I – As soluções para resolver o problema de valores ausentes são diversas, sendo as mais comuns: remoção do exemplar em que ocorre a falta do valor, preenchimento manual dos valores e preenchimento automático dos valores.
II – Os valores ruidosos referem-se a modificações dos valores originais e que, portanto, consistem em erros de medidas ou em valores consideravelmente diferentes da maioria dos outros valores do conjunto de dados, os chamados outliers. Há duas abordagens para o tratamento destes dados: inspeção e correção manual; e identificação e limpeza automática.
III - Procedimentos para integração de dados consistem em realizar ações que permitam integrar, adequadamente, dados provenientes de diversas fontes de dados. Geralmente, quando os dados provêm de diferentes fontes, os valores assumidos por atributos não possuem o mesmo domínio ou não estão formatados sob o mesmo tipo de dado, ainda que digam respeito à mesma descrição de uma entidade do mundo real. As principais motivações para a aplicação de procedimentos de integração de dados são, portanto, a presença de valores inconsistentes e a presença de valores redundantes.
De acordo com Silva, Peres e Boscarioli (2016), é CORRETO afirmar que:
I – A mineração de dados é uma disciplina exclusiva da engenharia da computação, utilizada como ferramenta por demais áreas de conhecimento.
II – As tarefas descritivas da mineração de dados fazem inferência a partir dos dados e possuem o objetivo de realizar predições.
III – Durante as tarefas de mineração de dados, os valores de dados outliers não podem ser descartados, para garantir a fidedignidade do modelo em uso.
Conforme Castro e Ferrari (2016), é CORRETO afirmar que:
I – As aplicações de OLAP são dominadas por consultas ad hoc complexas. Em termos de SQL (Structured Query Language), as consultas OLAP envolvem operadores de agrupamento e agregação e fornecem excelente suporte para condições booleanas complexas.
II – O problema fundamental na manutenção de um Data Warehouse é a manutenção síncrona de tabelas replicadas e visões materializadas.
III – A mineração de dados está relacionada à subárea da estatística chamada análise combinatória de dados.
RAGHU, R.; GEHRKE, J., Sistemas de Gerenciamento de Banco de Dados, 3° Ed. Editora McGraw-Hill, 2011.
Assinale a alternativa correta conforme Raghu e Gehrke (2011):
Julgue o item subsequente, relativos à teoria da informação e a banco de dados.
A mineração de dados é uma técnica em que se utilizam exclusivamente algoritmos de aprendizado supervisionado para a identificação de padrões em grandes volumes de dados; no contexto de Big Data, a premissa principal é a utilização de bancos de dados relacionais tradicionais, que são suficientes para o enfrentamento dos desafios de volume, variedade e velocidade característicos desse ambiente.
Acerca de segurança da informação, bancos de dados e aprendizado de máquina, julgue o próximo item.
A técnica de clustering em data mining atribui categorias aos grupos de dados para facilitar a análise e a tomada de decisão.
Considere as sentenças relacionadas às tarefas de mineração de dados.
I - As tarefas preditivas usam os valores dos atributos descritivos para prever valores futuros ou incógnitos de outros atributos de interesse.
II - As tarefas consultivas usam valores dos atributos para identificar modelos que podem ser utilizados na classificação e reconhecimento de padrões.
III - As tarefas descritivas têm o objetivo de reconhecer padrões que descrevem os dados de maneira que o ser humano possa interpretar.
IV - As tarefas imperativas são implementadas com linguagens de programação baseadas em paradigmas imperativos.
De acordo com Silva, Peres e Boscarioli (2016), é VERDADEIRO o que se afirma:
(SILVA, Leandro Augusto da; PERES, Sarajane Marques; BOSCARIOLI, Clodis. Introdução à Mineração de Dados Com Aplicações em R. Rio de Janeiro: Elsevier, 2016.)