Questões de Concurso Sobre análise multivariada em estatística

Foram encontradas 237 questões

Q4282408 Estatística
A área de gestão de um Tribunal de Contas pretende planejar ações de desenvolvimento organizacional para suas unidades.

Para cada unidade, foram consolidados indicadores relativos a:

• volume de demandas recebidas; • proporção de demandas concluídas no prazo;
• tempo médio de atendimento;
• taxa de absenteísmo;
• horas de capacitação por servidor;
• proporção de postos de trabalho não ocupados.

Não existem categorias previamente definidas para classificar as unidades, nem registros anteriormente rotulados que indiquem o perfil de cada uma.

Após o tratamento necessário para tornar comparáveis os indicadores, a área pretende identificar conjuntos de unidades com combinações semelhantes desses indicadores, a fim de subsidiar diagnósticos e ações de gestão.

Para atender à finalidade apresentada, o procedimento adequado consiste em
Alternativas
Q4255268 Estatística
Uma equipe de inteligência legislativa recebeu a tarefa de identificar perfis de atuação parlamentar a partir de informações históricas relacionadas à apresentação de proposições, participação em comissões, frequência em sessões, temas de interesse e padrões de votação. Como não existiam categorias previamente definidas para os parlamentares analisados, optou-se pela utilização de técnicas de agrupamento para identificar estruturas naturalmente presentes nos dados. Durante os testes, foi necessário selecionar um método adequado para particionar os registros em grupos representados por centroides calculados iterativamente.
Assinale a alternativa que apresenta uma característica tecnicamente associada ao algoritmo K-means.
Alternativas
Q4255232 Estatística
Uma equipe de ciência de dados do Poder Legislativo desenvolveu um estudo para identificar padrões ocultos em uma base contendo milhares de variáveis derivadas de proposições legislativas, registros de votação, indicadores orçamentários, participação em comissões, frequência de discursos e dados administrativos. Durante a análise exploratória, verificou-se que a elevada dimensionalidade dificultava a visualização dos dados e aumentava o custo computacional de diversas etapas analíticas. Diante desse cenário, foram avaliadas técnicas de redução de dimensionalidade com finalidades distintas de interpretação e exploração dos dados.
Assinale a alternativa que apresenta a interpretação tecnicamente adequada acerca das técnicas PCA e t-SNE.
Alternativas
Q4255229 Estatística
Uma equipe de análise de dados da Assembleia Legislativa recebeu a missão de identificar padrões de atuação parlamentar a partir de milhares de registros que continham informações sobre proposições apresentadas, votações realizadas, participação em comissões, temas recorrentes e indicadores de atividade legislativa. Como não existia uma classificação prévia dos parlamentares nem categorias definidas antecipadamente, optou-se pela utilização de técnicas de aprendizado não supervisionado para explorar possíveis agrupamentos naturais presentes na base de dados. Durante os testes, observou-se que alguns parlamentares possuíam comportamento muito distinto dos demais, formando pequenos grupos isolados em regiões de baixa densidade.
Assinale a alternativa que apresenta a técnica de agrupamento adequada para identificar agrupamentos de formatos arbitrários e, simultaneamente, reconhecer observações isoladas como potenciais ruídos.
Alternativas
Q4221495 Estatística
Auditores de uma Secretaria da Fazenda receberam a incumbência de analisar milhões de registros de notas fiscais eletrônicas, declarações tributárias e movimentações econômicas de contribuintes. O objetivo era identificar grupos de contribuintes com comportamentos semelhantes, verificar a evolução da arrecadação ao longo dos últimos anos e estimar possíveis cenários futuros para subsidiar ações de fiscalização e planejamento institucional. Nesse contexto, a afirmação tecnicamente correta é que
Alternativas
Q4220352 Estatística
O setor de inteligência de um Tribunal de Justiça deseja analisar o perfil de produtividade das Comarcas do Estado.
O banco de dados contém múltiplas variáveis correlacionadas, como o número de novos processos, o tempo médio de tramitação, a taxa de congestionamento e o número de magistrados.
O objetivo inicial é simplificar o conjunto de dados, transformando essas variáveis originais em um número menor de índices sintéticos que retenham a maior parte da variação original, facilitando a criação de um ranking de eficiência sem a redundância das informações correlacionadas.

Assinale a opção que apresenta o método de Estatística Multivariada mais apropriado para o objetivo especificado. 
Alternativas
Q4218179 Estatística
Um cientista de dados está desenvolvendo um modelo de segmentação para classificar procedimentos com base em características quantitativas.
Para garantir a comparabilidade entre variáveis, ele aplicou a padronização por escore z (z-score) em um conjunto de dados multivariados, de modo que todas as variáveis passassem a apresentar média 0 e desvio-padrão 1.
Após a padronização, verificou-se que os dados não apresentavam forte separação entre grupos naturais. Em seguida, foi aplicado o algoritmo K-means em Python:

from sklearn.preprocessing import StandardScaler
from sklearn.cluster import KMeans

scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)

kmeans = KMeans(n_clusters=3, n_init=10, random_state=0)
kmeans.fit(X_scaled)

print(kmeans.cluster_centers_)

Observou-se que os centroides obtidos apresentam valores próximos de zero em todas as dimensões.
Considerando o contexto descrito, esse resultado ocorre porque 
Alternativas
Q4210727 Estatística
Sobre conceitos e técnicas de Processamento de Linguagem Natural (PLN), analise as afirmativas a seguir.
I. Representações baseadas em n-gramas utilizam sequências contíguas de n itens textuais, podendo capturar padrões locais de palavras em documentos. II. Técnicas de redução de dimensionalidade, como Análise de Componentes Principais (PCA), podem ser utilizadas para representar textos em espaços vetoriais de menor dimensão. III. Modelagem de tópicos latentes, como LDA (Latent Dirichlet Allocation), é frequentemente utilizada para identificar temas recorrentes em coleções de documentos.
Está correto o que se afirma em
Alternativas
Q4210726 Estatística
Considere as seguintes técnicas frequentemente utilizadas em aprendizado de máquina:
I. Regressão logística. II. K-means. III. Random Forest. IV. Análise de Componentes Principais (PCA).
Em relação à classificação dessas técnicas em métodos supervisionados e não supervisionados, assinale a alternativa correta. 
Alternativas
Q4210724 Estatística
Determinada secretaria municipal de planejamento urbano está desenvolvendo um sistema de apoio à decisão para organizar regiões da cidade com perfis socioeconômicos semelhantes, visando melhor alocação de recursos públicos. Para isso, um analista de dados propôs o uso de diferentes técnicas de análise de agrupamentos (clusterização). Nesse contexto, assinale a afirmativa INCORRETA.
Alternativas
Q4198700 Estatística

No âmbito da análise de produtos entregues por consultorias contratadas pela INFRA S.A. para a caracterização de solos ferroviários, o fiscal deve validar a redução de dimensionalidade de dados multivariados. Acerca de métodos estatísticos e suas análises nesse contexto, julgue o item a seguir.


Caso a consultoria apresente PCA em que os dois primeiros componentes explicam 85% da variância total, o fiscal poderá atestar a conformidade técnica com o critério de Kaiser, mesmo que o autovalor do segundo componente seja inferior a 1,0, uma vez que a variância acumulada é o parâmetro soberano nesse método. 

Alternativas
Ano: 2026 Banca: DEPSEC Órgão: UNIFAP Prova: DEPSEC - 2026 - UNIFAP - Estatístico |
Q4186553 Estatística

Em relação às diferenças conceituais e aplicações da Análise de Componentes Principais (PCA) e da Análise Fatorial (AF), julgue os itens a seguir:



I. A PCA busca combinações lineares (componentes principais) que retêm a máxima variância total dos dados observados, sem postular um modelo de erros ou fatores latentes; já a Análise Fatorial assume que as variáveis observadas são funções lineares de fatores latentes comuns acrescidos de erros únicos (especificidades).


II. Na PCA, os componentes são ortogonais e ordenados por variância explicada; na Análise Fatorial, os fatores podem ser rotacionados (ex.: varimax) para facilitar a interpretação, e a comunalidade representa a proporção da variância de cada variável explicada pelos fatores comuns.


III. Uma diferença prática importante é que a PCA é frequentemente usada para redução de dimensionalidade quando o interesse é reter a maior parte da informação, enquanto a Análise Fatorial é mais adequada para identificar estruturas latentes subjacentes (ex.: traços de personalidade, construtos socioeconômicos).


IV. A PCA é invariante a rotações ortogonais dos componentes, ou seja, qualquer rotação dos eixos principais produz a mesma solução; já na Análise Fatorial, a rotação é essencial para tornar os fatores interpretáveis, e diferentes métodos de rotação podem levar a diferentes soluções fatoriais.


V. A PCA pressupõe que os dados seguem uma distribuição normal multivariada e que não há outliers, caso contrário os resultados são sempre inválidos; a Análise Fatorial, por outro lado, é robusta a qualquer tipo de distribuição e não requer normalidade.



Assinale a alternativa com a sequência CORRETA (V/F): 

Alternativas
Ano: 2026 Banca: DEPSEC Órgão: UNIFAP Prova: DEPSEC - 2026 - UNIFAP - Estatístico |
Q4186547 Estatística

Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:



I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.


II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.


III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".


IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.


V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):

Alternativas
Ano: 2026 Banca: DEPSEC Órgão: UNIFAP Prova: DEPSEC - 2026 - UNIFAP - Estatístico |
Q4186546 Estatística

Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.



Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado. 

Alternativas
Q4162701 Estatística
Uma técnica usual para compreender a variabilidade de dados de séries temporais espaçados irregularmente em um mapa é conhecida como Empirical Orthogonal Function (EOF). Sobre a referida análise, assinale a opção correta.
Alternativas
Q4119384 Estatística
Um psicólogo organizacional aplicou um questionário de clima organizacional com 40 itens em uma amostra de 500 servidores. Para verificar a estrutura fatorial do instrumento, ele realizou uma análise fatorial exploratória (AFE) com rotação varimax, obtendo 5 fatores com autovalores > 1, explicando 62% da variância total. No entanto, os itens de um dos fatores tinham cargas cruzadas (cross-loadings ) acima de 0,40 em dois outros fatores. Com base nos critérios de Hair et al. (2014) para validade de construto, a decisão metodológica mais rigorosa é:
Alternativas
Q4098366 Estatística
Um Professor do IFCE solicita que os alunos analisem dados numéricos coletados por sensores no campus, sem rótulos ou categorias prédefinidas. O objetivo é identificar automaticamente agrupamentos naturais nos dados, revelando padrões de similaridade sem utilizar informações externas. Para isso, o docente orienta que os estudantes escolham, entre os algoritmos estudados, aquele adequado para realizar clusterização em contexto não supervisionado. Diante desse contexto, assinale a alternativa que apresenta corretamente o algoritmo que os alunos devem escolher. 
Alternativas
Q4089520 Estatística
Na análise de agrupamentos, existem várias medidas que podem ser utilizadas como medidas de distância ou dissemelhança entre os elementos de uma matriz de dados. Além dessas medidas, é possível ter uma visualização do processo de agrupamento hierárquico por meio de gráficos. Nesse sentido, é correto afirmar que o dendograma pode ser feito aplicando 
Alternativas
Q4089519 Estatística
A análise de componentes principais é uma técnica de redução de dados em que o objetivo principal é a construção de uma combinação linear das principais variáveis que representa a totalidade. Então, nesse tipo de análise, são aplicados os seguintes gráficos: 
Alternativas
Q4067464 Estatística
Uma Secretaria Estadual analisa contribuintes do ICMS com variáveis numéricas contínuas padronizadas (faturamento, variação intermensal, frequência de retificações e uso de créditos), sem conhecimento prévio do número de grupos, e deseja obter uma estrutura hierárquica interpretável para priorização de auditorias. A combinação técnica que atende ao cenário descrito é
Alternativas
Respostas
1: A
2: E
3: C
4: E
5: C
6: E
7: B
8: A
9: A
10: C
11: E
12: D
13: C
14: C
15: A
16: B
17: E
18: A
19: B
20: E