Questões de Concurso
Sobre análise multivariada em estatística
Foram encontradas 237 questões
Para cada unidade, foram consolidados indicadores relativos a:
• volume de demandas recebidas; • proporção de demandas concluídas no prazo;
• tempo médio de atendimento;
• taxa de absenteísmo;
• horas de capacitação por servidor;
• proporção de postos de trabalho não ocupados.
Não existem categorias previamente definidas para classificar as unidades, nem registros anteriormente rotulados que indiquem o perfil de cada uma.
Após o tratamento necessário para tornar comparáveis os indicadores, a área pretende identificar conjuntos de unidades com combinações semelhantes desses indicadores, a fim de subsidiar diagnósticos e ações de gestão.
Para atender à finalidade apresentada, o procedimento adequado consiste em
Assinale a alternativa que apresenta uma característica tecnicamente associada ao algoritmo K-means.
Assinale a alternativa que apresenta a interpretação tecnicamente adequada acerca das técnicas PCA e t-SNE.
Assinale a alternativa que apresenta a técnica de agrupamento adequada para identificar agrupamentos de formatos arbitrários e, simultaneamente, reconhecer observações isoladas como potenciais ruídos.
O banco de dados contém múltiplas variáveis correlacionadas, como o número de novos processos, o tempo médio de tramitação, a taxa de congestionamento e o número de magistrados.
O objetivo inicial é simplificar o conjunto de dados, transformando essas variáveis originais em um número menor de índices sintéticos que retenham a maior parte da variação original, facilitando a criação de um ranking de eficiência sem a redundância das informações correlacionadas.
Assinale a opção que apresenta o método de Estatística Multivariada mais apropriado para o objetivo especificado.
Para garantir a comparabilidade entre variáveis, ele aplicou a padronização por escore z (z-score) em um conjunto de dados multivariados, de modo que todas as variáveis passassem a apresentar média 0 e desvio-padrão 1.
Após a padronização, verificou-se que os dados não apresentavam forte separação entre grupos naturais. Em seguida, foi aplicado o algoritmo K-means em Python:
from sklearn.preprocessing import StandardScaler
from sklearn.cluster import KMeans
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
kmeans = KMeans(n_clusters=3, n_init=10, random_state=0)
kmeans.fit(X_scaled)
print(kmeans.cluster_centers_)
Observou-se que os centroides obtidos apresentam valores próximos de zero em todas as dimensões.
Considerando o contexto descrito, esse resultado ocorre porque
I. Representações baseadas em n-gramas utilizam sequências contíguas de n itens textuais, podendo capturar padrões locais de palavras em documentos. II. Técnicas de redução de dimensionalidade, como Análise de Componentes Principais (PCA), podem ser utilizadas para representar textos em espaços vetoriais de menor dimensão. III. Modelagem de tópicos latentes, como LDA (Latent Dirichlet Allocation), é frequentemente utilizada para identificar temas recorrentes em coleções de documentos.
Está correto o que se afirma em
I. Regressão logística. II. K-means. III. Random Forest. IV. Análise de Componentes Principais (PCA).
Em relação à classificação dessas técnicas em métodos supervisionados e não supervisionados, assinale a alternativa correta.
No âmbito da análise de produtos entregues por consultorias contratadas pela INFRA S.A. para a caracterização de solos ferroviários, o fiscal deve validar a redução de dimensionalidade de dados multivariados. Acerca de métodos estatísticos e suas análises nesse contexto, julgue o item a seguir.
Caso a consultoria apresente PCA em que os dois primeiros componentes explicam 85% da variância total, o fiscal poderá atestar a conformidade técnica com o critério de Kaiser, mesmo que o autovalor do segundo componente seja inferior a 1,0, uma vez que a variância acumulada é o parâmetro soberano nesse método.
Em relação às diferenças conceituais e aplicações da Análise de Componentes Principais (PCA) e da Análise Fatorial (AF), julgue os itens a seguir:
I. A PCA busca combinações lineares (componentes principais) que retêm a máxima variância total dos dados observados, sem postular um modelo de erros ou fatores latentes; já a Análise Fatorial assume que as variáveis observadas são funções lineares de fatores latentes comuns acrescidos de erros únicos (especificidades).
II. Na PCA, os componentes são ortogonais e ordenados por variância explicada; na Análise Fatorial, os fatores podem ser rotacionados (ex.: varimax) para facilitar a interpretação, e a comunalidade representa a proporção da variância de cada variável explicada pelos fatores comuns.
III. Uma diferença prática importante é que a PCA é frequentemente usada para redução de dimensionalidade quando o interesse é reter a maior parte da informação, enquanto a Análise Fatorial é mais adequada para identificar estruturas latentes subjacentes (ex.: traços de personalidade, construtos socioeconômicos).
IV. A PCA é invariante a rotações ortogonais dos componentes, ou seja, qualquer rotação dos eixos principais produz a mesma solução; já na Análise Fatorial, a rotação é essencial para tornar os fatores interpretáveis, e diferentes métodos de rotação podem levar a diferentes soluções fatoriais.
V. A PCA pressupõe que os dados seguem uma distribuição normal multivariada e que não há outliers, caso contrário os resultados são sempre inválidos; a Análise Fatorial, por outro lado, é robusta a qualquer tipo de distribuição e não requer normalidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:
I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.
II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.
III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".
IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.
V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):
Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.
Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado.