Questões de Concurso Público UNIFAP 2026 para Estatístico
Foram encontradas 70 questões
Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.
Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado.
Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:
I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.
II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.
III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".
IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.
V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):
Uma variável aleatória X segue uma distribuição Qui-quadrado (X2 ) com 10 graus de liberdade. Em relação às propriedades da distribuição Qui-quadrado e suas aplicações, julgue os itens a seguir:
I. A média de X é igual aos graus de liberdade (E[X] = 10), e a variância é igual a duas vezes os graus de liberdade (Var(X) = 20).
II. A distribuição Qui-quadrado é simétrica em torno de sua média para qualquer número de graus de liberdade.
III. A variável X pode ser representada como a soma de
10 variáveis aleatórias independentes, cada uma com
distribuição Normal padrão ao quadrado: X =
, com Zi ~ N (0,1).
IV. A moda da distribuição X2 com v graus de liberdade ocorre em v − 2 (para v > 2). Assim, para v = 10, a moda é 8, que é menor que a média (10), evidenciando assimetria positiva.
V. A distribuição Qui-quadrado é um caso particular da distribuição Gama, com parâmetros de forma k = v/2 e escala θ = 2. Portanto, suas propriedades podem ser derivadas da família Gama.
Assinale a alternativa com a sequência CORRETA (V/F):
Uma amostra aleatória de tamanho n = 100 de uma população normalmente distribuída com média μ e variância σ2 forneceu os seguintes resultados:

Deseja-se testar:
H0: μ ≤ 80versus H1: μ > 80,
ao nível de significância de 5%. A variância populacional é desconhecida.
Assinale a alternativa que apresenta corretamente o critério de decisão baseado na estatística t (ou equivalentemente na média amostral xˉ) e a decisão correspondente:
Uma universidade deseja comparar três métodos de ensino (A, B, C) quanto ao desempenho dos estudantes. Inicialmente, planeja-se um delineamento inteiramente casualizado (DIC): 90 alunos são sorteados aleatoriamente e igualmente distribuídos entre os três métodos (30 por método). Um professor sugere usar delineamento em blocos casualizados (DBC), considerando o turno de estudo (manhã, tarde, noite) como bloco, pois acredita que o turno influencia o desempenho. Na universidade, há 30 alunos por turno (total 90). Em cada turno, os 30 alunos são aleatoriamente atribuídos aos três métodos (10 por método por turno). Em relação à análise e interpretação desses delineamentos, julgue os itens a seguir:
I. No DIC, a aleatorização é irrestrita: os 90 alunos são sorteados para os métodos sem considerar turno. A ANOVA correspondente particiona a variabilidade total em SQTratamentos (métodos) e SQResíduo. Se houver diferença significativa entre os métodos, o pesquisador pode concluir que o efeito é causal, desde que a alocação tenha sido aleatória.
II. No DBC com blocos de turno, a soma de quadrados total é decomposta em SQBlocos (turno), SQTratamentos (métodos) e SQResíduo. O DBC é mais eficiente que o DIC se a variabilidade entre blocos for grande, pois reduz a SQResíduo e aumenta o poder do teste F para os métodos.
III. Suponha que, no DBC, a interação entre bloco e tratamento não seja modelada (modelo aditivo – sem interação). Se houver interação real (ex.: o método A é melhor no turno da manhã, mas pior no noturno), essa interação irá para o resíduo, inflacionando o erro experimental e podendo mascarar efeitos principais ou gerar conclusões enganosas.
IV. Os graus de liberdade do resíduo no DIC são 90 − 3 = 87. No DBC com 3 blocos e 3 tratamentos e 10 repetições por combinação bloco×tratamento, os graus de liberdade do resíduo são (3 − 1) × (3 − 1) × 10 = 2 × 2 × 10 = 40.
V. Se um pesquisador aplicasse o DIC e, após verificar diferença significativa entre os métodos, incluísse o turno como covariável na análise de covariância (ANCOVA), isso equivaleria a um DBC com ajuste linear, desde que o efeito do turno fosse modelado como contínuo (ex.: hora de início). Contudo, se o turno for categórico (manhã, tarde, noite), a abordagem correta é o DBC ou a inclusão de dummies no modelo.
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de dados de um órgão público tem acesso a uma base com informações de beneficiários de programas sociais, contendo: CPF, nome completo, renda familiar, endereço, diagnóstico de saúde (opcional) e data de nascimento. Ele deseja publicar um estudo agregado por município, mantendo o sigilo dos indivíduos. Em relação à Lei Geral de Proteção de Dados (LGPD) e às boas práticas éticas em estatística pública, julgue os itens a seguir:
I. O CPF e o nome completo são considerados dados pessoais sensíveis pela LGPD, exigindo consentimento explícito do titular mesmo para uso em políticas públicas.
II. A anonimização, segundo a LGPD, é o processo de tornar os dados não associáveis a uma pessoa identificada ou identificável, usando técnicas como generalização, supressão ou ruído. Dados verdadeiramente anonimizados não são mais considerados dados pessoais.
III. O diagnóstico de saúde (ex.: HIV, câncer) é classificado como dado pessoal sensível pela LGPD (art. 5º, II), e seu tratamento requer fundamento legal específico, como a execução de políticas públicas pela administração pública (art. 7º, III).
IV. Publicar uma tabela com a renda média por município, sem qualquer identificador individual, é suficiente para garantir anonimização, independentemente do número de observações por município, pois dados agregados não violam a LGPD.
V. Em um estudo ético, o analista deve aplicar o princípio da minimização: coletar e armazenar apenas os dados estritamente necessários para a finalidade da análise, descartando identificadores diretos quando não forem mais úteis.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação à técnica de Bootstrap e suas aplicações em inferência estatística, julgue os itens a seguir:
I. A principal vantagem do Bootstrap é permitir estimar a distribuição amostral de uma estatística (ex.: média, mediana, coeficiente de correlação) sem assumir uma distribuição populacional específica, utilizando reamostragem com reposição a partir dos dados observados.
II. O Bootstrap reduz a necessidade de grandes amostras: com amostras muito pequenas (ex.: n = 5), o Bootstrap produz estimativas consistentes e não viesadas, mesmo quando a distribuição original é assimétrica.
III. O Bootstrap paramétrico assume uma forma paramétrica para a distribuição populacional (ex.: Normal) e reamostra a partir da distribuição estimada, enquanto o Bootstrap não paramétrico reamostra diretamente dos dados empíricos.
IV. O Bootstrap é computacionalmente mais eficiente que os métodos analíticos (ex.: fórmulas para erro padrão), pois requer apenas alguns segundos mesmo com milhões de reamostras, enquanto fórmulas analíticas exigem cálculos complexos e lentos.
V. O Bootstrap pode ser usado para construir intervalos de confiança (ex.: percentil, BCa), estimar viés de estimadores e calcular erros padrão, sendo especialmente útil quando a estatística de interesse não tem uma expressão analítica simples para sua variância.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação às diferenças conceituais e aplicações da Análise de Componentes Principais (PCA) e da Análise Fatorial (AF), julgue os itens a seguir:
I. A PCA busca combinações lineares (componentes principais) que retêm a máxima variância total dos dados observados, sem postular um modelo de erros ou fatores latentes; já a Análise Fatorial assume que as variáveis observadas são funções lineares de fatores latentes comuns acrescidos de erros únicos (especificidades).
II. Na PCA, os componentes são ortogonais e ordenados por variância explicada; na Análise Fatorial, os fatores podem ser rotacionados (ex.: varimax) para facilitar a interpretação, e a comunalidade representa a proporção da variância de cada variável explicada pelos fatores comuns.
III. Uma diferença prática importante é que a PCA é frequentemente usada para redução de dimensionalidade quando o interesse é reter a maior parte da informação, enquanto a Análise Fatorial é mais adequada para identificar estruturas latentes subjacentes (ex.: traços de personalidade, construtos socioeconômicos).
IV. A PCA é invariante a rotações ortogonais dos componentes, ou seja, qualquer rotação dos eixos principais produz a mesma solução; já na Análise Fatorial, a rotação é essencial para tornar os fatores interpretáveis, e diferentes métodos de rotação podem levar a diferentes soluções fatoriais.
V. A PCA pressupõe que os dados seguem uma distribuição normal multivariada e que não há outliers, caso contrário os resultados são sempre inválidos; a Análise Fatorial, por outro lado, é robusta a qualquer tipo de distribuição e não requer normalidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação aos componentes estruturais de uma série temporal, julgue os itens a seguir:
I. Picos e vales regulares a cada 12 meses indicam a presença de um componente sazonal.
II. O aumento gradual no volume de vendas ao longo dos anos caracteriza um componente de tendência.
III. Ciclos econômicos possuem período fixo e regular, como exatamente 12 meses.
IV. O componente irregular (ruído) é o principal responsável pelos picos e vales regulares observados.
V. Uma série que apresenta tendência e sazonalidade pode ser modelada por métodos como SARIMA.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação às bibliotecas estatísticas e de manipulação de dados, julgue os itens a seguir:
I. A biblioteca pandas, em Python, é amplamente utilizada para manipulação e análise de dados estruturados, oferecendo estruturas como DataFrame e Series.
II. O pacote ggplot2, em R, é voltado principalmente para modelagem estatística avançada, incluindo regressão logística e ANOVA.
III. Tanto pandas quanto ggplot2 são exclusivamente utilizados para criação de gráficos interativos em dashboards web.
IV. O ggplot2 implementa a Gramática dos Gráficos (Grammar of Graphics), permitindo construção de gráficos por camadas.
V. A função plot() do pandas é equivalente completa ao ggplot2 em termos de customização e qualidade gráfica.
Assinale a alternativa com a sequência CORRETA (V/F):