Questões de Concurso
Sobre análise discriminante em estatística
Foram encontradas 16 questões
Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:
I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.
II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.
III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".
IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.
V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):
Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.
Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado.
Os valores de precisão e recall para a classe P, nessa ordem, são
A partir dessa situação hipotética, julgue o seguinte item.
A análise discriminante procura maximizar a separação entre classes que definem a qualidade do ar (boa, moderada ou ruim) e utiliza combinações lineares dos níveis de poluentes e fatores meteorológicos.
A respeito dessa situação hipotética, julgue o próximo item.
Se o p-valor do teste de esfericidade for igual a 0,001, então a hipótese nula desse teste — de que os resíduos seguem uma distribuição normal — deve ser rejeitada sob nível de significância igual a 2%.

Para se avaliar a concordância entre os avaliadores, optou-se por usar o coeficiente Kappa, que é, no caso, igual a
I. A análise de correspondência permite estudar associação entre variáveis qualitativas.
II. Na análise discriminante a variável dependente deve ser métrica.
III. Na análise de regressão múltipla uma forma de identificar colinearidade entre as variáveis independentes é examinar as correlações entre essas variáveis.
IV. Na análise de conglomerados, as técnicas hierárquicas exigem que o usuário identifique previamente o número de grupos desejado, mas essa exigência não prevalece nas técnicas não hierárquicas.
Está correto o que se afirma APENAS em
No que se refere aos métodos estatísticos de análise multivariada empregados na situação descrita acima, julgue o seguinte item.
Empregando-se a análise discriminante, é possível separar estatisticamente os usuários insatisfeitos daqueles que se consideram satisfeitos, com base nas características do usuário. Essa técnica é uma forma especializada de regressão em que se ajusta a probabilidade de um indivíduo pertencer a um grupo ou a outro grupo com base no seu perfil (como, por exemplo, idade, gênero, renda e escolaridade).
Considere que, na análise discriminante por meio do escore quadrático, o vetor x seja classificado na população k se
Nesse caso, se existirem apenas 2 populações (g = 2), e se S = S1 = S2, então a expressão de Qk(x) não dependerá de x, mas apenas de
Na análise discriminante por meio do escore de Fisher, convencionou-se que os dados seguem distribuição normal.
Para orientar os investimentos em educação em certo município, um analista foi contratado para criar um ranking das escolas públicas desse município. Para cada escola, as variáveis disponíveis são a quantidade de turmas, a quantidade de alunos, a quantidade de professores, a nota da Prova Brasil e a área do terreno.
A partir dessa situação, julgue o item.
I. Na análise discriminante, uma suposição para a determinação da função discriminante é a de normalidade multivariada das variáveis independentes.
II. A análise de correspondência não é sensível a observações atípicas, como outliers.
III. A escalagem multidimensional se baseia em distâncias euclidianas em projeção plana entre variáveis.
É correto o que consta APENAS em
I. Uma técnica não hierárquica da análise de agrupamentos é o método das K-médias.
II. O modelo de análise fatorial procura descrever a variabilidade de um vetor aleatório p-dimensional X, em termos de um vetor aleatório m-dimensional (m<p), linearmente relacionado com X.
III. O objetivo principal da análise de componentes principais é o de explicar a estrutura de variância e covariância de um vetor aleatório através da construção de combinações lineares das variáveis originais.
IV. Na aplicação da análise discriminante é necessário que os grupos para os quais cada elemento amostral pode ser classificado sejam pré-definidos.
Está correto o que se afirma em