Questões de Concurso Público UNIFAP 2026 para Estatístico
Foram encontradas 70 questões
Em um estudo sobre a produtividade científica de uma universidade, um pesquisador classificou os projetos de pesquisa de uma grande faculdade em duas categorias: aqueles que resultaram em publicação em periódico de alto impacto e aqueles que não atingiram esse patamar. Sabe-se que 25% dos projetos da faculdade são da área de Ciências Biológicas. Entre os projetos da área de Ciências Biológicas, 60% resultaram em publicação de alto impacto. Entre os projetos das demais áreas (Ciências Exatas, Humanas etc.), a taxa de sucesso (publicação de alto impacto) é de 30%. Um projeto de pesquisa é selecionado aleatoriamente do banco de dados da universidade e verifica-se que ele resultou em uma publicação de alto impacto.
A probabilidade de que esse projeto seja da área de Ciências Biológicas é, aproximadamente:
Um pesquisador da gestão pública analisou a distribuição salarial de servidores de um órgão federal: média = 50 mil, mediana = 45 mil, moda = 40 mil. Em relação ao comportamento dessa distribuição, julgue os itens a seguir:
I. A relação média > mediana > moda indica assimetria positiva (à direita), ou seja, a cauda da distribuição se alonga para valores mais altos, puxando a média para cima.
II. Em uma distribuição assimétrica positiva, a média é maior que a mediana, que por sua vez é maior que a moda. O fato de haver poucos salários muito elevados influencia a média mais do que a mediana.
III. Se a distribuição fosse simétrica, esperaríamos média = mediana = moda (aproximadamente). No caso apresentado, a diferença indica assimetria à direita.
IV. A curtose da distribuição pode ser avaliada pela comparação entre média e mediana; como a média é maior que a mediana, a distribuição é leptocúrtica (caudas pesadas).
V. Em uma distribuição com assimetria positiva, a mediana é geralmente a medida de tendência central mais robusta para representar o salário típico, pois não é puxada pelos valores extremos.
Assinale a alternativa com a sequência CORRETA (V/F):
Em uma análise de desempenho institucional, um estatístico precisa comparar a dispersão de indicadores de produtividade entre departamentos com médias e escalas distintas. Ele utiliza inicialmente o desvio padrão amostral. Em relação às propriedades, limitações e relações do desvio padrão com outras medidas estatísticas, julgue os itens a seguir:
I. Se os dados de um departamento seguem uma distribuição assimétrica à direita, o desvio padrão é necessariamente maior do que o desvio médio absoluto (MAD), devido à maior ponderação dos desvios quadráticos.
II. O coeficiente de variação (CV) é uma medida adimensional que permite comparar dispersão entre variáveis com diferentes unidades, mas sua utilização é inadequada quando a média se aproxima de zero, independentemente da natureza dos dados.
III. Para uma amostra aleatória simples de uma população com variância finita, o desvio padrão amostral (com correção de Bessel) é um estimador não viesado do desvio padrão populacional.
IV. Se todos os valores de um indicador forem transformados por Y = α + bX, com b > 0, o desvio padrão de Y é igual a b vezes o desvio padrão de X, independentemente do valor de α.
V. Em qualquer distribuição com média finita e variância finita, a desigualdade de Chebyshev garante que a proporção de observações dentro de k desvios padrão da média é de pelo menos 1 − 1/k2 , sendo essa uma cota superior para qualquer distribuição.
Assinale a alternativa com a sequência CORRETA (V/F):
Em um estudo sobre falhas operacionais em sistemas públicos, definem-se os eventos:
A: falha elétrica
B: falha no sistema de comunicação
Sabe-se que P(A) = 0,5, P(B) = 0,4 e que A e B são independentes.
Em relação a conceitos de probabilidade, independência e suas implicações, julgue os itens a seguir:
I. A probabilidade de ocorrência simultânea das duas falhas é P (A ∩ B) = 0,2, pois para eventos independentes a interseção é o produto das probabilidades marginais.
II. Se A e B são independentes, então também são independentes os eventos complementares Ac e Bc, e além disso P (AC ∩ BC ) = 0,3
III. A independência de dois eventos implica necessariamente que eles sejam disjuntos (mutuamente exclusivos), a menos que um deles tenha probabilidade zero.
IV. Se um terceiro evento C for independente de A e também independente de B, então necessariamente C é independente da interseção A ∩ B. Essa propriedade é válida para qualquer espaço de probabilidade.
V. A definição formal de independência entre A e B é P (A ∩ B) = P (A) P (B), mas uma condição equivalente, quando P (B) > 0, é P (A ∣ B) = P (A).
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de dados utiliza o Excel em nível avançado para análises estatísticas. Em relação a recursos e limitações do Excel para análises mais complexas, julgue os itens a seguir:
I. As fórmulas matriciais (array formulas), ativadas com Ctrl+Shift+Enter em versões antigas ou dinâmicas nas versões recentes do Microsoft 365, permitem realizar cálculos que retornam múltiplos valores ou que processam matrizes sem a necessidade de células auxiliares, como =SOMA(SE(A1:A10>5;A1:A10)) para somar valores maiores que 5.
II. O Power Pivot é um suplemento do Excel que utiliza o mecanismo de banco de dados colunar xVelocity, permitindo trabalhar com grandes volumes de dados (milhões de linhas) e criar relacionamentos entre tabelas, além de usar a linguagem DAX (Data Analysis Expressions) para medidas complexas, incluindo funções de inteligência de tempo como TOTALYTD.
III. A linguagem DAX possui funções estatísticas avançadas equivalentes às do R, como regressão logística, PCA e árvores de decisão, executáveis diretamente dentro de uma medida no Power Pivot.
IV. O Excel possui um limite de 1.048.576 linhas por planilha. Para conjuntos de dados maiores que esse limite, o Power Pivot pode importar e analisar dados além dessa capacidade, pois armazena os dados de forma comprimida na memória, independentemente do limite de linhas da planilha.
V. Os gráficos dinâmicos (PivotCharts) são totalmente interativos e permitem que o usuário altere campos de filtro, linhas e colunas dinamicamente, sendo uma ferramenta útil para dashboards. No entanto, eles herdam as limitações das tabelas dinâmicas, como a incapacidade de criar certos tipos de gráficos (ex.: dispersão com bolhas ou gráficos de superfície) diretamente a partir de uma tabela dinâmica.
Assinale a alternativa com a sequência CORRETA (V/F):
Durante um levantamento estatístico, um pesquisador modelou uma variável aleatória associada ao resultado de inspeções em equipamentos públicos, classificando cada inspeção apenas como “aprovada” (sucesso) ou “reprovada” (fracasso). Essa variável é tipicamente modelada por uma distribuição de Bernoulli. Em relação às propriedades da distribuição de Bernoulli e suas relações com outras distribuições, julgue os itens a seguir:
I. Se X ~ Bernoulli(p), então a função de probabilidade é dada por P(X = x) = px (1 − p)1−x para x ∈ {0,1}, e a média é igual à variância.
II. A soma de n variáveis independentes e identicamente distribuídas (i.i.d.) com distribuição Bernoulli(p) resulta em uma distribuição Binomial(n, p), cuja variância é np(1 − p).
III. O coeficiente de assimetria (skewness) de uma
Bernoulli(p) é dado por
, que se anula quando p = 0,5.
IV. A distribuição de Bernoulli pode ser vista como um caso particular da distribuição Binomial com n = 1, mas também como um caso especial da distribuição Categórica com duas categorias.
V. Se X ~ Bernoulli(p), então o estimador de máxima verossimilhança (EMV) de p é a média amostral, e esse estimador é não viesado, consistente e eficiente para grandes amostras.
Assinale a alternativa com a sequência CORRETA (V/F):
Uma equipe de auditoria realiza 10 inspeções independentes em contratos administrativos. A probabilidade de encontrar irregularidade em cada inspeção é de 0,2. Seja X o número de contratos irregulares encontrados. Sabe-se que X ~ Binomial(n = 10, p = 0,2). Em relação às propriedades dessa distribuição e conceitos associados, julgue os itens a seguir:
I. O valor esperado de X é E [X] = np = 2, e a variância é Var(X) = np(1 − p) = 1,6.
II. A função geradora de momentos (MGF) de X é MX(t) = (1 − p + pet )n , e a partir dela é possível obter todos os momentos centrais e não centrais da distribuição.
III. Para n = 10 e p = 0,2, a distribuição Binomial pode ser aproximada por uma distribuição Normal com média 2 e variância 1,6, desde que se aplique correção de continuidade, e essa aproximação será excelente porque n é grande.
IV. O estimador de máxima verossimilhança (EMV) de p para uma amostra de uma única observação X dessa Binomial(10, p) é p = X/10, e esse estimador é não viesado.
V. A probabilidade de encontrar exatamente 2 contratos irregulares é dada por P(X = 2) = ( 10 2 )(0,2)2 (0,8)8.
Se o número de inspeções aumentasse para 100, mantendo a probabilidade de irregularidade, a distribuição tenderia a uma Poisson com parâmetro λ = 20 (desde que n → ∞ e p → 0 com np constante).
Assinale a alternativa com a sequência CORRETA (V/F):
Um centro de monitoramento registra o número de panes em servidores de dados por hora. As ocorrências são raras, independentes e acontecem em intervalos fixos de tempo, caracterizando um processo de Poisson. Em relação à modelagem e propriedades da distribuição de Poisson e suas relações com outras distribuições, julgue os itens a seguir:
I. Se o número médio de panes por hora é λ = 3, a
probabilidade de exatamente 5 panes em uma hora é
dada por P(X = 5) =
. Além disso, para um
processo de Poisson, a média e a variância são iguais.
II. A distribuição de Poisson pode ser obtida como limite da distribuição Binomial quando n → ∞, p → 0 e np = λ (constante). Essa aproximação é tanto melhor quanto maior for n e menor for p.
III. Em um processo de Poisson homogêneo, o tempo entre ocorrências consecutivas segue uma distribuição Exponencial com média 1/λ, e a soma de k tempos entre ocorrências independentes segue uma distribuição Gama (Erlang) com parâmetros k e λ.
IV. Se o número de panes por hora segue Poisson (λ), então a transformação Y = √X (transformação estabilizadora de variância) tem variância aproximadamente constante igual a 1/4, independentemente de λ, para λ grande.
V. O estimador de máxima verossimilhança de n para
uma amostra de λ horas independentes é a média
amostral
, e esse estimador é não viesado, consistente
e eficiente, atingindo a cota inferior de Cramér-Rao
para grandes amostras.
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de confiabilidade está interessado em estudar o tempo médio entre falhas consecutivas em equipamentos hospitalares de alta complexidade.
Para modelar esse tipo de variável aleatória, a distribuição mais apropriada é:
Ao padronizar indicadores de desempenho institucional, um pesquisador transformou os dados para a escala Z.
Na distribuição normal padrão, a média e a variância são, respectivamente:
Um analista de confiabilidade está interessado em estudar o tempo médio entre falhas consecutivas (TBF – Time Between Failures) em equipamentos hospitalares de alta complexidade. Para modelar essa variável aleatória contínua e não negativa, a distribuição Exponencial é frequentemente utilizada. Em relação às propriedades da distribuição Exponencial e suas aplicações em análise de confiabilidade, julgue os itens a seguir:
I. Se T ~ Exponencial (λ) (com função densidade ƒ(t) = λ e−λt , t ≥ 0, e média 1/λ), então a função de risco (taxa de falha) é constante e igual a λ, o que caracteriza ausência de memória: P (T > t + s ∣ T > s) = P (T > t).
II. A distribuição Exponencial é o único modelo contínuo com propriedade de falta de memória, e isso a torna inadequada para modelar equipamentos com desgaste (taxa de falha crescente), mas adequada para falhas aleatórias não relacionadas ao envelhecimento.
III. Se o número de falhas em um intervalo de tempo segue um processo de Poisson homogêneo com taxa λ, então o tempo entre falhas consecutivas segue uma distribuição Exponencial com média 1/λ. Além disso, o tempo até a k-ésima falha segue uma distribuição Gama (Erlang) com parâmetros k e λ.
IV. Para uma amostra aleatória T1, T2, … , Tn i.i.d. Exponencial(λ), o estimador de máxima verossimilhança de λ é λ = 1/Tˉ, que é um estimador não viesado para λ.
V. O coeficiente de variação (CV) da distribuição Exponencial é igual a 1, independentemente do valor de λ, o que significa que o desvio padrão é igual à média. Esse é um critério diagnóstico útil para verificar a adequação do modelo exponencial a dados empíricos.
Assinale a alternativa com a sequência CORRETA (V/F):
Em um estudo sobre a qualidade de vida em grandes centros urbanos, foram coletadas as seguintes informações de uma amostra de 1.000 indivíduos:
I. Nível de escolaridade (Fundamental, Médio, Superior, Pós-graduação).
II. Renda mensal (em salários-mínimos).
III. Número de filhos.
IV. Satisfação com o transporte público (Muito Insatisfeito, Insatisfeito, Neutro, Satisfeito, Muito Satisfeito).
Assinale a alternativa que classifica corretamente os tipos de variáveis apresentadas.
Um analista de dados está comparando a variabilidade salarial entre dois departamentos de uma empresa. O Departamento A tem um salário médio de R$ 5.000 com um desvio padrão de R$ 1.000. O Departamento B tem um salário médio de R$ 8.000 com um desvio padrão de R$ 1.200.
Para comparar a variabilidade relativa entre os dois departamentos, qual medida estatística deve ser utilizada e qual departamento apresenta maior variabilidade relativa?
Ao realizar um teste de hipóteses para a média de uma população com amostras pequenas (n < 30) e desvio padrão populacional desconhecido, a distribuição t de Student é a mais apropriada para construir o intervalo de confiança ou calcular o valor p. Em relação à teoria da distribuição t e sua aplicação, julgue os itens a seguir:
I. A estatística de teste
segue exatamente uma
distribuição t de Student com n − 1 graus de liberdade
se a população for normal. Se a população não for
normal, mas for simétrica e com curtose moderada, o
teste t ainda é razoavelmente robusto para amostras
pequenas.
II. A distribuição t de Student tem caudas mais pesadas que a distribuição Normal padrão, mas à medida que os graus de liberdade aumentam, a t se aproxima da Normal. Para n ≥ 30, a diferença é geralmente considerada desprezível na prática.
III. O intervalo de confiança para a média usando a
distribuição t é dado por
Se,
erroneamente, usássemos o quantil da Normal (Zα/2) no
lugar do t, o intervalo seria mais estreito, aumentando a
probabilidade de não conter o verdadeiro parâmetro
(cobertura abaixo do nominal).
IV. Para testar a média de uma população com amostra pequena e desvio padrão desconhecido, a distribuição Qui-quadrado (X 2) seria apropriada se o interesse fosse na variância, não na média. Já a distribuição F é usada para comparação de duas variâncias ou em ANOVA.
V. A estatística t de Student para uma amostra pode ser derivada como razão entre uma Normal padrão e a raiz quadrada de uma Qui-quadrado dividida por seus graus de liberdade, assumindo independência. Essa relação justifica o nome “t” e a forma da densidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Um teste de hipóteses bicaudal foi realizado para verificar se a média de vendas diárias de um produto (μ) é diferente de R$ 1.000. As hipóteses são H0: μ = 1000 e H1: μ ≠ 1000. O valor p calculado foi de 0,035, e o nível de significância adotado foi α = 0,05. Em relação à interpretação e aos conceitos associados a esse resultado, julgue os itens a seguir:
I. A conclusão correta é rejeitar H0 ao nível de 5%, pois p = 0,035 < 0,05. Isso significa que a probabilidade de se obter um resultado tão extremo quanto o observado, assumindo H0 verdadeira, é de apenas 3,5%.
II. Rejeitar H0 nesse contexto implica que a probabilidade de cometer um erro tipo I (rejeitar H0 quando ela é verdadeira) é exatamente igual ao valor p (3,5%), independentemente do escolhido a priori.
III. Se o nível de significância fosse 1% (α = 0,01), a conclusão seria diferente: não rejeitaríamos H0, pois p = 0,035 > 0,01. Isso mostra que a conclusão do teste depende da escolha de α antes da análise.
IV. O valor p de 0,035 indica que a probabilidade de H0 ser verdadeira é de 3,5%. Essa é uma interpretação incorreta, mas comumente encontrada em práticas não estatísticas.
V. Para um teste bicaudal, o valor p é definido como 2 × P(T ≥∣ tobs ∣∣ H0) quando a distribuição do teste é simétrica. Se o teste fosse unilateral à direita com a mesma estatística, o valor p seria metade (0,0175), e com α = 0,05 também levaria à rejeição de H0.
Assinale a alternativa com a sequência CORRETA (V/F):
Em uma avaliação de impacto de um novo programa de atenção primária à saúde, um gestor público modela a probabilidade de óbito em até 30 dias (variável resposta binária: 1 = óbito, 0 = sobrevida) usando regressão logística binária, com variáveis explicativas: idade, índice de comorbidades, adesão ao protocolo e condição socioeconômica. Em relação à teoria e prática da regressão logística, julgue os itens a seguir:
I. O modelo de regressão logística estima a probabilidade P(Y = 1 ∣ X) = 1 / 1+e−Xβ, sendo que os parâmetros β são obtidos por máxima verossimilhança (MV), e diferentemente do modelo linear de probabilidade (MLP), os valores preditos ficam restritos ao intervalo [0,1].
II. Se o coeficiente estimado para idade for βidade = 0,05, a interpretação é que um aumento de uma unidade na idade está associado a um aumento de 5% na probabilidade de óbito, mantendo as demais variáveis constantes.
III. O modelo logístico não requer normalidade dos resíduos nem homocedasticidade, mas exige independência das observações e ausência de multicolinearidade perfeita ou quase perfeita.
IV. A área sob a curva ROC (AUC) é uma medida de acurácia discriminativa do modelo: valores próximos a 0,5 indicam discriminação aleatória, enquanto valores acima de 0,8 sugerem bom poder discriminativo.
V. O teste de Hosmer-Lemeshow é frequentemente usado para avaliar a calibração do modelo logístico, ou seja, se as probabilidades preditas correspondem às frequências observadas. Um resultado não significativo (p > 0,05) indica boa calibração.
Assinale a alternativa com a sequência CORRETA (V/F):
Um gestor público de políticas de desenvolvimento agrícola deseja avaliar se três diferentes fórmulas de biofertilizante (F1, F2, F3) produzem efeitos distintos sobre o crescimento inicial de mudas de espécies nativas destinadas a projetos de recuperação de áreas degradadas. Para isso, foi conduzido um experimento completamente casualizado com 60 parcelas homogêneas. As parcelas foram aleatorizadas para receber um dos três fertilizantes (n = 20 por grupo). A variável resposta é o incremento em altura (cm) após 60 dias. Após a coleta dos dados, o gestor observa que a distribuição dos resíduos do modelo apresenta leve assimetria à direita e caudas ligeiramente mais pesadas que a distribuição normal. Ele decide testar a homogeneidade das variâncias entre os grupos (teste de Levene, p = 0,12). O tamanho amostral por grupo é razoável (n = 20), e o interesse primário é comparar as médias dos três grupos, controlando o erro tipo I em 5%.
Com base nesse cenário e nos princípios de estatística experimental, assinale a alternativa CORRETA quanto à técnica mais apropriada para a análise dos dados, justificando os pressupostos e possíveis alternativas.
Um órgão de controle da administração pública federal dispõe de um banco de dados com 12 indicadores socioeconômicos (PIB per capita, IDH, desigualdade de renda, taxa de analfabetismo, mortalidade infantil, etc.) coletados para 550 municípios. O objetivo é reduzir a dimensionalidade dos dados para construir um índice sintético de desenvolvimento municipal que preserve o máximo possível da variância original, sem utilizar uma variável resposta predefinida. O estatístico do órgão decide aplicar a Análise de Componentes Principais (PCA) com base na matriz de correlações (variáveis padronizadas). Após a análise, os autovalores obtidos foram: λ₁ = 4,2; λ₂ = 2,1; λ₃ = 1,8; λ₄ = 1,2; λ₅ = 0,9; os demais somam 1,8.
Com base nesses resultados e nos fundamentos da PCA, assinale a alternativa CORRETA:
Em uma pesquisa de clima organizacional aplicada a 2.000 servidores públicos federais, foram coletadas respostas a 20 perguntas (escala Likert de 1 a 5). O estatístico responsável deseja identificar construtos latentes subjacentes (ex.: satisfação com liderança, engajamento, condições de trabalho) que expliquem as correlações observadas entre as variáveis manifestas. Para isso, ele opta pela Análise Fatorial por Eixos Principais com rotação oblíqua (promax), após verificar que o teste de esfericidade de Bartlett foi significativo (p < 0,001) e a medida KMO = 0,87. Avalie as afirmativas a seguir como verdadeiras (V) ou falsas (F):
( ) A Análise Fatorial exige que as variáveis originais sejam independentes entre si, condição verificada pelo teste de Bartlett significativo.
( ) A rotação varimax (ortogonal) seria mais adequada do que a promax, pois a rotação oblíqua sempre produz fatores correlacionados, o que invalida o modelo.
( ) O teste KMO mede a adequação da amostra para a análise fatorial; valores acima de 0,8 indicam boa adequação, como no caso apresentado.
( ) Na Análise Fatorial, as comunalidades representam a parcela da variância total de cada variável que não é explicada pelos fatores comuns.
( ) A rotação dos fatores altera a solução matemática dos autovalores e a variância total explicada, sendo desaconselhada quando o objetivo é puramente redução de dimensionalidade.
As afirmativas são respectivamente: