Questões de Concurso
Para estatístico
Foram encontradas 4.514 questões
Resolva questões gratuitamente!
Junte-se a mais de 4 milhões de concurseiros!
Em relação às bibliotecas estatísticas e de manipulação de dados, julgue os itens a seguir:
I. A biblioteca pandas, em Python, é amplamente utilizada para manipulação e análise de dados estruturados, oferecendo estruturas como DataFrame e Series.
II. O pacote ggplot2, em R, é voltado principalmente para modelagem estatística avançada, incluindo regressão logística e ANOVA.
III. Tanto pandas quanto ggplot2 são exclusivamente utilizados para criação de gráficos interativos em dashboards web.
IV. O ggplot2 implementa a Gramática dos Gráficos (Grammar of Graphics), permitindo construção de gráficos por camadas.
V. A função plot() do pandas é equivalente completa ao ggplot2 em termos de customização e qualidade gráfica.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação aos componentes estruturais de uma série temporal, julgue os itens a seguir:
I. Picos e vales regulares a cada 12 meses indicam a presença de um componente sazonal.
II. O aumento gradual no volume de vendas ao longo dos anos caracteriza um componente de tendência.
III. Ciclos econômicos possuem período fixo e regular, como exatamente 12 meses.
IV. O componente irregular (ruído) é o principal responsável pelos picos e vales regulares observados.
V. Uma série que apresenta tendência e sazonalidade pode ser modelada por métodos como SARIMA.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação às diferenças conceituais e aplicações da Análise de Componentes Principais (PCA) e da Análise Fatorial (AF), julgue os itens a seguir:
I. A PCA busca combinações lineares (componentes principais) que retêm a máxima variância total dos dados observados, sem postular um modelo de erros ou fatores latentes; já a Análise Fatorial assume que as variáveis observadas são funções lineares de fatores latentes comuns acrescidos de erros únicos (especificidades).
II. Na PCA, os componentes são ortogonais e ordenados por variância explicada; na Análise Fatorial, os fatores podem ser rotacionados (ex.: varimax) para facilitar a interpretação, e a comunalidade representa a proporção da variância de cada variável explicada pelos fatores comuns.
III. Uma diferença prática importante é que a PCA é frequentemente usada para redução de dimensionalidade quando o interesse é reter a maior parte da informação, enquanto a Análise Fatorial é mais adequada para identificar estruturas latentes subjacentes (ex.: traços de personalidade, construtos socioeconômicos).
IV. A PCA é invariante a rotações ortogonais dos componentes, ou seja, qualquer rotação dos eixos principais produz a mesma solução; já na Análise Fatorial, a rotação é essencial para tornar os fatores interpretáveis, e diferentes métodos de rotação podem levar a diferentes soluções fatoriais.
V. A PCA pressupõe que os dados seguem uma distribuição normal multivariada e que não há outliers, caso contrário os resultados são sempre inválidos; a Análise Fatorial, por outro lado, é robusta a qualquer tipo de distribuição e não requer normalidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Em relação à técnica de Bootstrap e suas aplicações em inferência estatística, julgue os itens a seguir:
I. A principal vantagem do Bootstrap é permitir estimar a distribuição amostral de uma estatística (ex.: média, mediana, coeficiente de correlação) sem assumir uma distribuição populacional específica, utilizando reamostragem com reposição a partir dos dados observados.
II. O Bootstrap reduz a necessidade de grandes amostras: com amostras muito pequenas (ex.: n = 5), o Bootstrap produz estimativas consistentes e não viesadas, mesmo quando a distribuição original é assimétrica.
III. O Bootstrap paramétrico assume uma forma paramétrica para a distribuição populacional (ex.: Normal) e reamostra a partir da distribuição estimada, enquanto o Bootstrap não paramétrico reamostra diretamente dos dados empíricos.
IV. O Bootstrap é computacionalmente mais eficiente que os métodos analíticos (ex.: fórmulas para erro padrão), pois requer apenas alguns segundos mesmo com milhões de reamostras, enquanto fórmulas analíticas exigem cálculos complexos e lentos.
V. O Bootstrap pode ser usado para construir intervalos de confiança (ex.: percentil, BCa), estimar viés de estimadores e calcular erros padrão, sendo especialmente útil quando a estatística de interesse não tem uma expressão analítica simples para sua variância.
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de dados de um órgão público tem acesso a uma base com informações de beneficiários de programas sociais, contendo: CPF, nome completo, renda familiar, endereço, diagnóstico de saúde (opcional) e data de nascimento. Ele deseja publicar um estudo agregado por município, mantendo o sigilo dos indivíduos. Em relação à Lei Geral de Proteção de Dados (LGPD) e às boas práticas éticas em estatística pública, julgue os itens a seguir:
I. O CPF e o nome completo são considerados dados pessoais sensíveis pela LGPD, exigindo consentimento explícito do titular mesmo para uso em políticas públicas.
II. A anonimização, segundo a LGPD, é o processo de tornar os dados não associáveis a uma pessoa identificada ou identificável, usando técnicas como generalização, supressão ou ruído. Dados verdadeiramente anonimizados não são mais considerados dados pessoais.
III. O diagnóstico de saúde (ex.: HIV, câncer) é classificado como dado pessoal sensível pela LGPD (art. 5º, II), e seu tratamento requer fundamento legal específico, como a execução de políticas públicas pela administração pública (art. 7º, III).
IV. Publicar uma tabela com a renda média por município, sem qualquer identificador individual, é suficiente para garantir anonimização, independentemente do número de observações por município, pois dados agregados não violam a LGPD.
V. Em um estudo ético, o analista deve aplicar o princípio da minimização: coletar e armazenar apenas os dados estritamente necessários para a finalidade da análise, descartando identificadores diretos quando não forem mais úteis.
Assinale a alternativa com a sequência CORRETA (V/F):
Uma universidade deseja comparar três métodos de ensino (A, B, C) quanto ao desempenho dos estudantes. Inicialmente, planeja-se um delineamento inteiramente casualizado (DIC): 90 alunos são sorteados aleatoriamente e igualmente distribuídos entre os três métodos (30 por método). Um professor sugere usar delineamento em blocos casualizados (DBC), considerando o turno de estudo (manhã, tarde, noite) como bloco, pois acredita que o turno influencia o desempenho. Na universidade, há 30 alunos por turno (total 90). Em cada turno, os 30 alunos são aleatoriamente atribuídos aos três métodos (10 por método por turno). Em relação à análise e interpretação desses delineamentos, julgue os itens a seguir:
I. No DIC, a aleatorização é irrestrita: os 90 alunos são sorteados para os métodos sem considerar turno. A ANOVA correspondente particiona a variabilidade total em SQTratamentos (métodos) e SQResíduo. Se houver diferença significativa entre os métodos, o pesquisador pode concluir que o efeito é causal, desde que a alocação tenha sido aleatória.
II. No DBC com blocos de turno, a soma de quadrados total é decomposta em SQBlocos (turno), SQTratamentos (métodos) e SQResíduo. O DBC é mais eficiente que o DIC se a variabilidade entre blocos for grande, pois reduz a SQResíduo e aumenta o poder do teste F para os métodos.
III. Suponha que, no DBC, a interação entre bloco e tratamento não seja modelada (modelo aditivo – sem interação). Se houver interação real (ex.: o método A é melhor no turno da manhã, mas pior no noturno), essa interação irá para o resíduo, inflacionando o erro experimental e podendo mascarar efeitos principais ou gerar conclusões enganosas.
IV. Os graus de liberdade do resíduo no DIC são 90 − 3 = 87. No DBC com 3 blocos e 3 tratamentos e 10 repetições por combinação bloco×tratamento, os graus de liberdade do resíduo são (3 − 1) × (3 − 1) × 10 = 2 × 2 × 10 = 40.
V. Se um pesquisador aplicasse o DIC e, após verificar diferença significativa entre os métodos, incluísse o turno como covariável na análise de covariância (ANCOVA), isso equivaleria a um DBC com ajuste linear, desde que o efeito do turno fosse modelado como contínuo (ex.: hora de início). Contudo, se o turno for categórico (manhã, tarde, noite), a abordagem correta é o DBC ou a inclusão de dummies no modelo.
Assinale a alternativa com a sequência CORRETA (V/F):
Uma amostra aleatória de tamanho n = 100 de uma população normalmente distribuída com média μ e variância σ2 forneceu os seguintes resultados:

Deseja-se testar:
H0: μ ≤ 80versus H1: μ > 80,
ao nível de significância de 5%. A variância populacional é desconhecida.
Assinale a alternativa que apresenta corretamente o critério de decisão baseado na estatística t (ou equivalentemente na média amostral xˉ) e a decisão correspondente:
Uma variável aleatória X segue uma distribuição Qui-quadrado (X2 ) com 10 graus de liberdade. Em relação às propriedades da distribuição Qui-quadrado e suas aplicações, julgue os itens a seguir:
I. A média de X é igual aos graus de liberdade (E[X] = 10), e a variância é igual a duas vezes os graus de liberdade (Var(X) = 20).
II. A distribuição Qui-quadrado é simétrica em torno de sua média para qualquer número de graus de liberdade.
III. A variável X pode ser representada como a soma de
10 variáveis aleatórias independentes, cada uma com
distribuição Normal padrão ao quadrado: X =
, com Zi ~ N (0,1).
IV. A moda da distribuição X2 com v graus de liberdade ocorre em v − 2 (para v > 2). Assim, para v = 10, a moda é 8, que é menor que a média (10), evidenciando assimetria positiva.
V. A distribuição Qui-quadrado é um caso particular da distribuição Gama, com parâmetros de forma k = v/2 e escala θ = 2. Portanto, suas propriedades podem ser derivadas da família Gama.
Assinale a alternativa com a sequência CORRETA (V/F):
Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:
I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.
II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.
III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".
IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.
V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):
Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.
Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado.
Em uma pesquisa de clima organizacional aplicada a 2.000 servidores públicos federais, foram coletadas respostas a 20 perguntas (escala Likert de 1 a 5). O estatístico responsável deseja identificar construtos latentes subjacentes (ex.: satisfação com liderança, engajamento, condições de trabalho) que expliquem as correlações observadas entre as variáveis manifestas. Para isso, ele opta pela Análise Fatorial por Eixos Principais com rotação oblíqua (promax), após verificar que o teste de esfericidade de Bartlett foi significativo (p < 0,001) e a medida KMO = 0,87. Avalie as afirmativas a seguir como verdadeiras (V) ou falsas (F):
( ) A Análise Fatorial exige que as variáveis originais sejam independentes entre si, condição verificada pelo teste de Bartlett significativo.
( ) A rotação varimax (ortogonal) seria mais adequada do que a promax, pois a rotação oblíqua sempre produz fatores correlacionados, o que invalida o modelo.
( ) O teste KMO mede a adequação da amostra para a análise fatorial; valores acima de 0,8 indicam boa adequação, como no caso apresentado.
( ) Na Análise Fatorial, as comunalidades representam a parcela da variância total de cada variável que não é explicada pelos fatores comuns.
( ) A rotação dos fatores altera a solução matemática dos autovalores e a variância total explicada, sendo desaconselhada quando o objetivo é puramente redução de dimensionalidade.
As afirmativas são respectivamente:
Um órgão de controle da administração pública federal dispõe de um banco de dados com 12 indicadores socioeconômicos (PIB per capita, IDH, desigualdade de renda, taxa de analfabetismo, mortalidade infantil, etc.) coletados para 550 municípios. O objetivo é reduzir a dimensionalidade dos dados para construir um índice sintético de desenvolvimento municipal que preserve o máximo possível da variância original, sem utilizar uma variável resposta predefinida. O estatístico do órgão decide aplicar a Análise de Componentes Principais (PCA) com base na matriz de correlações (variáveis padronizadas). Após a análise, os autovalores obtidos foram: λ₁ = 4,2; λ₂ = 2,1; λ₃ = 1,8; λ₄ = 1,2; λ₅ = 0,9; os demais somam 1,8.
Com base nesses resultados e nos fundamentos da PCA, assinale a alternativa CORRETA:
Um gestor público de políticas de desenvolvimento agrícola deseja avaliar se três diferentes fórmulas de biofertilizante (F1, F2, F3) produzem efeitos distintos sobre o crescimento inicial de mudas de espécies nativas destinadas a projetos de recuperação de áreas degradadas. Para isso, foi conduzido um experimento completamente casualizado com 60 parcelas homogêneas. As parcelas foram aleatorizadas para receber um dos três fertilizantes (n = 20 por grupo). A variável resposta é o incremento em altura (cm) após 60 dias. Após a coleta dos dados, o gestor observa que a distribuição dos resíduos do modelo apresenta leve assimetria à direita e caudas ligeiramente mais pesadas que a distribuição normal. Ele decide testar a homogeneidade das variâncias entre os grupos (teste de Levene, p = 0,12). O tamanho amostral por grupo é razoável (n = 20), e o interesse primário é comparar as médias dos três grupos, controlando o erro tipo I em 5%.
Com base nesse cenário e nos princípios de estatística experimental, assinale a alternativa CORRETA quanto à técnica mais apropriada para a análise dos dados, justificando os pressupostos e possíveis alternativas.
Em uma avaliação de impacto de um novo programa de atenção primária à saúde, um gestor público modela a probabilidade de óbito em até 30 dias (variável resposta binária: 1 = óbito, 0 = sobrevida) usando regressão logística binária, com variáveis explicativas: idade, índice de comorbidades, adesão ao protocolo e condição socioeconômica. Em relação à teoria e prática da regressão logística, julgue os itens a seguir:
I. O modelo de regressão logística estima a probabilidade P(Y = 1 ∣ X) = 1 / 1+e−Xβ, sendo que os parâmetros β são obtidos por máxima verossimilhança (MV), e diferentemente do modelo linear de probabilidade (MLP), os valores preditos ficam restritos ao intervalo [0,1].
II. Se o coeficiente estimado para idade for βidade = 0,05, a interpretação é que um aumento de uma unidade na idade está associado a um aumento de 5% na probabilidade de óbito, mantendo as demais variáveis constantes.
III. O modelo logístico não requer normalidade dos resíduos nem homocedasticidade, mas exige independência das observações e ausência de multicolinearidade perfeita ou quase perfeita.
IV. A área sob a curva ROC (AUC) é uma medida de acurácia discriminativa do modelo: valores próximos a 0,5 indicam discriminação aleatória, enquanto valores acima de 0,8 sugerem bom poder discriminativo.
V. O teste de Hosmer-Lemeshow é frequentemente usado para avaliar a calibração do modelo logístico, ou seja, se as probabilidades preditas correspondem às frequências observadas. Um resultado não significativo (p > 0,05) indica boa calibração.
Assinale a alternativa com a sequência CORRETA (V/F):
Um teste de hipóteses bicaudal foi realizado para verificar se a média de vendas diárias de um produto (μ) é diferente de R$ 1.000. As hipóteses são H0: μ = 1000 e H1: μ ≠ 1000. O valor p calculado foi de 0,035, e o nível de significância adotado foi α = 0,05. Em relação à interpretação e aos conceitos associados a esse resultado, julgue os itens a seguir:
I. A conclusão correta é rejeitar H0 ao nível de 5%, pois p = 0,035 < 0,05. Isso significa que a probabilidade de se obter um resultado tão extremo quanto o observado, assumindo H0 verdadeira, é de apenas 3,5%.
II. Rejeitar H0 nesse contexto implica que a probabilidade de cometer um erro tipo I (rejeitar H0 quando ela é verdadeira) é exatamente igual ao valor p (3,5%), independentemente do escolhido a priori.
III. Se o nível de significância fosse 1% (α = 0,01), a conclusão seria diferente: não rejeitaríamos H0, pois p = 0,035 > 0,01. Isso mostra que a conclusão do teste depende da escolha de α antes da análise.
IV. O valor p de 0,035 indica que a probabilidade de H0 ser verdadeira é de 3,5%. Essa é uma interpretação incorreta, mas comumente encontrada em práticas não estatísticas.
V. Para um teste bicaudal, o valor p é definido como 2 × P(T ≥∣ tobs ∣∣ H0) quando a distribuição do teste é simétrica. Se o teste fosse unilateral à direita com a mesma estatística, o valor p seria metade (0,0175), e com α = 0,05 também levaria à rejeição de H0.
Assinale a alternativa com a sequência CORRETA (V/F):
Ao realizar um teste de hipóteses para a média de uma população com amostras pequenas (n < 30) e desvio padrão populacional desconhecido, a distribuição t de Student é a mais apropriada para construir o intervalo de confiança ou calcular o valor p. Em relação à teoria da distribuição t e sua aplicação, julgue os itens a seguir:
I. A estatística de teste
segue exatamente uma
distribuição t de Student com n − 1 graus de liberdade
se a população for normal. Se a população não for
normal, mas for simétrica e com curtose moderada, o
teste t ainda é razoavelmente robusto para amostras
pequenas.
II. A distribuição t de Student tem caudas mais pesadas que a distribuição Normal padrão, mas à medida que os graus de liberdade aumentam, a t se aproxima da Normal. Para n ≥ 30, a diferença é geralmente considerada desprezível na prática.
III. O intervalo de confiança para a média usando a
distribuição t é dado por
Se,
erroneamente, usássemos o quantil da Normal (Zα/2) no
lugar do t, o intervalo seria mais estreito, aumentando a
probabilidade de não conter o verdadeiro parâmetro
(cobertura abaixo do nominal).
IV. Para testar a média de uma população com amostra pequena e desvio padrão desconhecido, a distribuição Qui-quadrado (X 2) seria apropriada se o interesse fosse na variância, não na média. Já a distribuição F é usada para comparação de duas variâncias ou em ANOVA.
V. A estatística t de Student para uma amostra pode ser derivada como razão entre uma Normal padrão e a raiz quadrada de uma Qui-quadrado dividida por seus graus de liberdade, assumindo independência. Essa relação justifica o nome “t” e a forma da densidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de dados está comparando a variabilidade salarial entre dois departamentos de uma empresa. O Departamento A tem um salário médio de R$ 5.000 com um desvio padrão de R$ 1.000. O Departamento B tem um salário médio de R$ 8.000 com um desvio padrão de R$ 1.200.
Para comparar a variabilidade relativa entre os dois departamentos, qual medida estatística deve ser utilizada e qual departamento apresenta maior variabilidade relativa?
Em um estudo sobre a qualidade de vida em grandes centros urbanos, foram coletadas as seguintes informações de uma amostra de 1.000 indivíduos:
I. Nível de escolaridade (Fundamental, Médio, Superior, Pós-graduação).
II. Renda mensal (em salários-mínimos).
III. Número de filhos.
IV. Satisfação com o transporte público (Muito Insatisfeito, Insatisfeito, Neutro, Satisfeito, Muito Satisfeito).
Assinale a alternativa que classifica corretamente os tipos de variáveis apresentadas.
Um analista de confiabilidade está interessado em estudar o tempo médio entre falhas consecutivas (TBF – Time Between Failures) em equipamentos hospitalares de alta complexidade. Para modelar essa variável aleatória contínua e não negativa, a distribuição Exponencial é frequentemente utilizada. Em relação às propriedades da distribuição Exponencial e suas aplicações em análise de confiabilidade, julgue os itens a seguir:
I. Se T ~ Exponencial (λ) (com função densidade ƒ(t) = λ e−λt , t ≥ 0, e média 1/λ), então a função de risco (taxa de falha) é constante e igual a λ, o que caracteriza ausência de memória: P (T > t + s ∣ T > s) = P (T > t).
II. A distribuição Exponencial é o único modelo contínuo com propriedade de falta de memória, e isso a torna inadequada para modelar equipamentos com desgaste (taxa de falha crescente), mas adequada para falhas aleatórias não relacionadas ao envelhecimento.
III. Se o número de falhas em um intervalo de tempo segue um processo de Poisson homogêneo com taxa λ, então o tempo entre falhas consecutivas segue uma distribuição Exponencial com média 1/λ. Além disso, o tempo até a k-ésima falha segue uma distribuição Gama (Erlang) com parâmetros k e λ.
IV. Para uma amostra aleatória T1, T2, … , Tn i.i.d. Exponencial(λ), o estimador de máxima verossimilhança de λ é λ = 1/Tˉ, que é um estimador não viesado para λ.
V. O coeficiente de variação (CV) da distribuição Exponencial é igual a 1, independentemente do valor de λ, o que significa que o desvio padrão é igual à média. Esse é um critério diagnóstico útil para verificar a adequação do modelo exponencial a dados empíricos.
Assinale a alternativa com a sequência CORRETA (V/F):
Ao padronizar indicadores de desempenho institucional, um pesquisador transformou os dados para a escala Z.
Na distribuição normal padrão, a média e a variância são, respectivamente: