Questões de Concurso
Sobre conhecimentos de estatística em estatística
Foram encontradas 1.231 questões
Um analista de dados de um órgão público tem acesso a uma base com informações de beneficiários de programas sociais, contendo: CPF, nome completo, renda familiar, endereço, diagnóstico de saúde (opcional) e data de nascimento. Ele deseja publicar um estudo agregado por município, mantendo o sigilo dos indivíduos. Em relação à Lei Geral de Proteção de Dados (LGPD) e às boas práticas éticas em estatística pública, julgue os itens a seguir:
I. O CPF e o nome completo são considerados dados pessoais sensíveis pela LGPD, exigindo consentimento explícito do titular mesmo para uso em políticas públicas.
II. A anonimização, segundo a LGPD, é o processo de tornar os dados não associáveis a uma pessoa identificada ou identificável, usando técnicas como generalização, supressão ou ruído. Dados verdadeiramente anonimizados não são mais considerados dados pessoais.
III. O diagnóstico de saúde (ex.: HIV, câncer) é classificado como dado pessoal sensível pela LGPD (art. 5º, II), e seu tratamento requer fundamento legal específico, como a execução de políticas públicas pela administração pública (art. 7º, III).
IV. Publicar uma tabela com a renda média por município, sem qualquer identificador individual, é suficiente para garantir anonimização, independentemente do número de observações por município, pois dados agregados não violam a LGPD.
V. Em um estudo ético, o analista deve aplicar o princípio da minimização: coletar e armazenar apenas os dados estritamente necessários para a finalidade da análise, descartando identificadores diretos quando não forem mais úteis.
Assinale a alternativa com a sequência CORRETA (V/F):
Uma amostra aleatória de tamanho n = 100 de uma população normalmente distribuída com média μ e variância σ2 forneceu os seguintes resultados:

Deseja-se testar:
H0: μ ≤ 80versus H1: μ > 80,
ao nível de significância de 5%. A variância populacional é desconhecida.
Assinale a alternativa que apresenta corretamente o critério de decisão baseado na estatística t (ou equivalentemente na média amostral xˉ) e a decisão correspondente:
Em uma pesquisa de clima organizacional aplicada a 2.000 servidores públicos federais, foram coletadas respostas a 20 perguntas (escala Likert de 1 a 5). O estatístico responsável deseja identificar construtos latentes subjacentes (ex.: satisfação com liderança, engajamento, condições de trabalho) que expliquem as correlações observadas entre as variáveis manifestas. Para isso, ele opta pela Análise Fatorial por Eixos Principais com rotação oblíqua (promax), após verificar que o teste de esfericidade de Bartlett foi significativo (p < 0,001) e a medida KMO = 0,87. Avalie as afirmativas a seguir como verdadeiras (V) ou falsas (F):
( ) A Análise Fatorial exige que as variáveis originais sejam independentes entre si, condição verificada pelo teste de Bartlett significativo.
( ) A rotação varimax (ortogonal) seria mais adequada do que a promax, pois a rotação oblíqua sempre produz fatores correlacionados, o que invalida o modelo.
( ) O teste KMO mede a adequação da amostra para a análise fatorial; valores acima de 0,8 indicam boa adequação, como no caso apresentado.
( ) Na Análise Fatorial, as comunalidades representam a parcela da variância total de cada variável que não é explicada pelos fatores comuns.
( ) A rotação dos fatores altera a solução matemática dos autovalores e a variância total explicada, sendo desaconselhada quando o objetivo é puramente redução de dimensionalidade.
As afirmativas são respectivamente:
Um órgão de controle da administração pública federal dispõe de um banco de dados com 12 indicadores socioeconômicos (PIB per capita, IDH, desigualdade de renda, taxa de analfabetismo, mortalidade infantil, etc.) coletados para 550 municípios. O objetivo é reduzir a dimensionalidade dos dados para construir um índice sintético de desenvolvimento municipal que preserve o máximo possível da variância original, sem utilizar uma variável resposta predefinida. O estatístico do órgão decide aplicar a Análise de Componentes Principais (PCA) com base na matriz de correlações (variáveis padronizadas). Após a análise, os autovalores obtidos foram: λ₁ = 4,2; λ₂ = 2,1; λ₃ = 1,8; λ₄ = 1,2; λ₅ = 0,9; os demais somam 1,8.
Com base nesses resultados e nos fundamentos da PCA, assinale a alternativa CORRETA:
Um teste de hipóteses bicaudal foi realizado para verificar se a média de vendas diárias de um produto (μ) é diferente de R$ 1.000. As hipóteses são H0: μ = 1000 e H1: μ ≠ 1000. O valor p calculado foi de 0,035, e o nível de significância adotado foi α = 0,05. Em relação à interpretação e aos conceitos associados a esse resultado, julgue os itens a seguir:
I. A conclusão correta é rejeitar H0 ao nível de 5%, pois p = 0,035 < 0,05. Isso significa que a probabilidade de se obter um resultado tão extremo quanto o observado, assumindo H0 verdadeira, é de apenas 3,5%.
II. Rejeitar H0 nesse contexto implica que a probabilidade de cometer um erro tipo I (rejeitar H0 quando ela é verdadeira) é exatamente igual ao valor p (3,5%), independentemente do escolhido a priori.
III. Se o nível de significância fosse 1% (α = 0,01), a conclusão seria diferente: não rejeitaríamos H0, pois p = 0,035 > 0,01. Isso mostra que a conclusão do teste depende da escolha de α antes da análise.
IV. O valor p de 0,035 indica que a probabilidade de H0 ser verdadeira é de 3,5%. Essa é uma interpretação incorreta, mas comumente encontrada em práticas não estatísticas.
V. Para um teste bicaudal, o valor p é definido como 2 × P(T ≥∣ tobs ∣∣ H0) quando a distribuição do teste é simétrica. Se o teste fosse unilateral à direita com a mesma estatística, o valor p seria metade (0,0175), e com α = 0,05 também levaria à rejeição de H0.
Assinale a alternativa com a sequência CORRETA (V/F):
Um analista de confiabilidade está interessado em estudar o tempo médio entre falhas consecutivas em equipamentos hospitalares de alta complexidade.
Para modelar esse tipo de variável aleatória, a distribuição mais apropriada é:
Um centro de monitoramento registra o número de panes em servidores de dados por hora. As ocorrências são raras, independentes e acontecem em intervalos fixos de tempo, caracterizando um processo de Poisson. Em relação à modelagem e propriedades da distribuição de Poisson e suas relações com outras distribuições, julgue os itens a seguir:
I. Se o número médio de panes por hora é λ = 3, a
probabilidade de exatamente 5 panes em uma hora é
dada por P(X = 5) =
. Além disso, para um
processo de Poisson, a média e a variância são iguais.
II. A distribuição de Poisson pode ser obtida como limite da distribuição Binomial quando n → ∞, p → 0 e np = λ (constante). Essa aproximação é tanto melhor quanto maior for n e menor for p.
III. Em um processo de Poisson homogêneo, o tempo entre ocorrências consecutivas segue uma distribuição Exponencial com média 1/λ, e a soma de k tempos entre ocorrências independentes segue uma distribuição Gama (Erlang) com parâmetros k e λ.
IV. Se o número de panes por hora segue Poisson (λ), então a transformação Y = √X (transformação estabilizadora de variância) tem variância aproximadamente constante igual a 1/4, independentemente de λ, para λ grande.
V. O estimador de máxima verossimilhança de n para
uma amostra de λ horas independentes é a média
amostral
, e esse estimador é não viesado, consistente
e eficiente, atingindo a cota inferior de Cramér-Rao
para grandes amostras.
Assinale a alternativa com a sequência CORRETA (V/F):
Durante um levantamento estatístico, um pesquisador modelou uma variável aleatória associada ao resultado de inspeções em equipamentos públicos, classificando cada inspeção apenas como “aprovada” (sucesso) ou “reprovada” (fracasso). Essa variável é tipicamente modelada por uma distribuição de Bernoulli. Em relação às propriedades da distribuição de Bernoulli e suas relações com outras distribuições, julgue os itens a seguir:
I. Se X ~ Bernoulli(p), então a função de probabilidade é dada por P(X = x) = px (1 − p)1−x para x ∈ {0,1}, e a média é igual à variância.
II. A soma de n variáveis independentes e identicamente distribuídas (i.i.d.) com distribuição Bernoulli(p) resulta em uma distribuição Binomial(n, p), cuja variância é np(1 − p).
III. O coeficiente de assimetria (skewness) de uma
Bernoulli(p) é dado por
, que se anula quando p = 0,5.
IV. A distribuição de Bernoulli pode ser vista como um caso particular da distribuição Binomial com n = 1, mas também como um caso especial da distribuição Categórica com duas categorias.
V. Se X ~ Bernoulli(p), então o estimador de máxima verossimilhança (EMV) de p é a média amostral, e esse estimador é não viesado, consistente e eficiente para grandes amostras.
Assinale a alternativa com a sequência CORRETA (V/F):
Em um estudo sobre falhas operacionais em sistemas públicos, definem-se os eventos:
A: falha elétrica
B: falha no sistema de comunicação
Sabe-se que P(A) = 0,5, P(B) = 0,4 e que A e B são independentes.
Em relação a conceitos de probabilidade, independência e suas implicações, julgue os itens a seguir:
I. A probabilidade de ocorrência simultânea das duas falhas é P (A ∩ B) = 0,2, pois para eventos independentes a interseção é o produto das probabilidades marginais.
II. Se A e B são independentes, então também são independentes os eventos complementares Ac e Bc, e além disso P (AC ∩ BC ) = 0,3
III. A independência de dois eventos implica necessariamente que eles sejam disjuntos (mutuamente exclusivos), a menos que um deles tenha probabilidade zero.
IV. Se um terceiro evento C for independente de A e também independente de B, então necessariamente C é independente da interseção A ∩ B. Essa propriedade é válida para qualquer espaço de probabilidade.
V. A definição formal de independência entre A e B é P (A ∩ B) = P (A) P (B), mas uma condição equivalente, quando P (B) > 0, é P (A ∣ B) = P (A).
Assinale a alternativa com a sequência CORRETA (V/F):
Sobre a afirmação, assinale a alternativa CORRETA.
Sobre esta afirmação, assinale a alternativa CORRETA.
22 25 25 22 25 20 29
Ao analisar esses dados, o RH percebeu que o salário de R$ 12.000,00 agia como um outlier (valor discrepante), distorcendo as medidas de tendência central. Com base no conjunto de dados apresentado, assinale a alternativa correta:
Um valor médio que seja representativo desse conjunto de dados, pode ser corretamente obtido pelo cálculo da
120, 150, 150, 180, 200, 200, 200, 220, 300
Com base nesses dados, analise as afirmativas:
I. A média de votos por seção é igual a 200.
II. A mediana do número de votos é 200.
III. A moda é 200.
Assinale a alternativa correta:
Em relação a esses conceitos, assinale a alternativa correta.
Os valores correspondentes ao tempo, em horas, gasto por cinco servidores em determinada atividade foram:
4, 6, 6, 8, 10.
Nesse conjunto de dados,