Uno psicologo ipotizza che un programma di mindfulness riduca il livello medio di stress rispetto alla norma nazionale di \(\mu_0 = 40\). Raccoglie un campione di \(n = 25\) partecipanti, ottiene \(\bar{x} = 36\) e conosce \(\sigma = 10\). Fissa \(\alpha = 0.05\). Dalla tavola: \(z_{0.05} = 1.645\). Qual è la corretta formulazione del test e la decisione?

Poiché l'ipotesi è direzionale (riduzione dello stress), si usa un test unilaterale sinistro: \(H_0: \mu = 40\) contro \(H_1: \mu < 40\). La statistica test è \(z = (\bar{x} - \mu_0)/(\sigma/\sqrt{n}) = (36-40)/(10/5) = -4/2 = -2.00\). La regione di rifiuto per un test unilaterale sinistro con \(\alpha = 0.05\) è \(z < -z_{0.05} = -1.645\). Poiché \(-2.00 < -1.645\), si rifiuta \(H_0\). La seconda opzione individua correttamente \(z\) ma applica erroneamente la regola bilaterale prendendo il valore assoluto. La terza formula il test come bilaterale, perdendo la direzionalità dell'ipotesi e usando il valore critico sbagliato. La quarta calcola \(z\) con segno positivo, ignorando che \(\bar{x} < \mu_0\).

  • False
  • False
  • True
  • False

Un ricercatore verifica \(H_0: \mu = 100\) contro \(H_1: \mu \neq 100\) con \(\alpha = 0.05\). La popolazione ha \(\sigma = 15\) (nota). Raccoglie \(n = 25\) osservazioni e ottiene \(\bar{x} = 104\). Dalla tavola: \(z_{0.025} = 1.96\). Qual è la statistica test \(z\) e la decisione corretta?

La statistica test è \(z = (\bar{x} - \mu_0)/(\sigma/\sqrt{n}) = (104-100)/(15/\sqrt{25}) = 4/3 = 1.33\). Per un test bilaterale con \(\alpha = 0.05\), la regola di rifiuto è \(|z| > 1.96\). Poiché \(|1.33| = 1.33 < 1.96\), non si rifiuta \(H_0\): i dati non forniscono evidenza sufficiente che la media differisca da 100. La seconda e la quarta opzione individuano correttamente \(z\) ma sbagliano la regola di decisione, confrontando \(z\) con \(\alpha\) invece che con il valore critico: \(z\) e \(\alpha\) non sono sulla stessa scala. La terza divide per \(n\) invece che per \(\sqrt{n}\) nel calcolo dell'errore standard: \(15/25 = 0.6\), ottenendo \(z = 4/0.6 \approx 6.67\).

  • False
  • False
  • False
  • True

Un ricercatore vuole applicare il test \(z\) sulla media (con \(\sigma\) nota) a un campione di \(n = 50\) osservazioni estratte da una popolazione con distribuzione asimmetrica (non normale). Può farlo legittimamente?

Il test \(z\) presuppone formalmente la normalità della popolazione per avere distribuzione esatta con qualsiasi \(n\). Tuttavia, per il teorema del limite centrale, con \(n\) sufficientemente grande la distribuzione di \(\bar{X}\) è approssimativamente normale indipendentemente dalla forma della popolazione: il test \(z\) diventa quindi asintoticamente valido. Con \(n = 50\) l'approssimazione è in genere ottima, salvo distribuzioni estremamente asimmetriche o con code molto pesanti. Non è vero che il test \(z\) non richiede mai la normalità: con campioni piccoli (es. \(n < 20\)) e popolazione molto non normale, l'approssimazione normale di \(\bar{X}\) può essere inadeguata. Non esiste alcuna regola che imponga di raddoppiare \(n\): la qualità dell'approssimazione dipende dalla forma della distribuzione della popolazione, non da una soglia fissa.

  • False
  • False
  • True
  • False

Un ricercatore mantiene fisso il livello di significatività \(\alpha = 0.05\) e aumenta la numerosità campionaria da \(n = 30\) a \(n = 120\), tenendo costanti tutte le altre condizioni. Quale effetto ha questo aumento su errore di I tipo ed errore di II tipo?

Il livello di significatività \(\alpha\) è fissato a priori dal ricercatore e non dipende da \(n\): l'errore di I tipo rimane esattamente 0.05. L'errore di II tipo \(\beta\) (probabilità di non rifiutare \(H_0\) quando è falsa) invece diminuisce all'aumentare di \(n\), perché con campioni più grandi la distribuzione campionaria di \(\bar{X}\) diventa più concentrata attorno al vero parametro, rendendo più facile distinguere \(H_0\) dalla realtà. Di conseguenza la potenza \(1 - \beta\) aumenta. Questo è il meccanismo fondamentale per cui aumentare \(n\) migliora la capacità del test di rilevare effetti reali, senza però alterare il controllo dell'errore di I tipo.

  • False
  • False
  • True
  • False

In uno studio sull'efficacia di una terapia cognitivo-comportamentale per la depressione, il gruppo trattato ha una media di \(\bar{x}_1 = 18\) e il gruppo di controllo ha \(\bar{x}_2 = 24\) su una scala di depressione. La deviazione standard comune è \(s = 10\). Qual è il valore della \(d\) di Cohen?

La \(d\) di Cohen misura la dimensione dell'effetto come differenza standardizzata tra le medie: \(d = |\bar{x}_1 - \bar{x}_2| / s = |18 - 24| / 10 = 6/10 = \mathbf{0.60}\). Secondo le convenzioni di Cohen (1988), \(d = 0.60\) è un effetto medio-grande (tra la soglia media \(d = 0.50\) e quella grande \(d = 0.80\)). Il valore 6.00 è la differenza grezza non standardizzata: ha senso solo nella scala originale e non è confrontabile tra studi diversi. Il valore 0.06 divide per 100 invece che per 10. Il valore 1.67 inverte il rapporto: \(10/6 \approx 1.67\).

  • False
  • True
  • False
  • False

Secondo le convenzioni di Cohen per la \(d\) di Cohen, come vengono classificate le dimensioni dell'effetto?

Cohen (1988) ha proposto soglie convenzionali per interpretare la \(d\) in ambito comportamentale e sociale: piccolo \(d \approx 0.20\), medio \(d \approx 0.50\), grande \(d \approx 0.80\). Queste soglie sono puramente orientative e non sostituiscono la valutazione della rilevanza pratica nel contesto specifico della ricerca. La seconda opzione propone soglie troppo conservative. La terza le raddoppia tutte, suggerendo implicitamente che effetti di dimensione media siano difficilmente raggiungibili. La quarta è quasi corretta per piccolo e medio ma sbaglia la soglia grande, abbassandola a 0.60.

  • False
  • False
  • True
  • False

In uno studio su \(n = 2000\) pazienti, una nuova terapia farmacologica riduce la media dei punteggi di ansia da 50.0 a 49.3 punti (su scala 0--100). Il test risulta statisticamente significativo con \(p = 0.001\). Un clinico osserva però che una riduzione di 0.7 punti non ha alcun valore pratico per il paziente. Chi ha ragione?

Con campioni molto grandi anche effetti minuscoli producono p-value bassissimi, perché la potenza del test diventa elevatissima. La significatività statistica (\(p < \alpha\)) risponde alla domanda "c'è evidenza che l'effetto sia diverso da zero?"; la significatività clinica (o pratica) risponde alla domanda "l'effetto è abbastanza grande da essere utile nella pratica?". Le due domande sono indipendenti: un effetto può essere statisticamente significativo ma clinicamente trascurabile (come in questo caso), oppure clinicamente rilevante ma non raggiungere la significatività statistica per campione troppo piccolo. Per questo è essenziale riportare sempre le dimensioni dell'effetto (es. \(d\) di Cohen) insieme al p-value.

  • False
  • False
  • True
  • False

Un ricercatore ottiene \(p = 0.07\) con \(\alpha = 0.05\) e commenta: "Il risultato è marginalmente significativo, il che suggerisce una tendenza verso la significatività." Quale delle seguenti valutazioni di questo commento è corretta?

La decisione nella verifica di ipotesi è binaria: con \(\alpha = 0.05\) fissato a priori, un p-value di 0.07 porta al **non rifiuto di \(H_0\)$, punto. Espressioni come "marginalmente significativo", "tendenza alla significatività" o "quasi significativo" non hanno fondamento nella teoria della verifica di ipotesi e sono criticate dalla comunità scientifica (Wasserstein & Lazar, 2016) perché introducono una scala di grigi che il framework non prevede. Il confine \(\alpha\) è convenzionale: \(p = 0.049\) e \(p = 0.051\) sono praticamente identici come evidenza empirica, ma la regola di decisione non prevede gradazioni. Il problema si risolve riportando sempre il p-value esatto e le dimensioni dell'effetto, lasciando al lettore la valutazione della rilevanza pratica.

  • False
  • True
  • False
  • False

La potenza di un test statistico è definita come \(1 - \beta\), dove \(\beta\) è la probabilità di errore di II tipo. Quale dei seguenti fattori non aumenta la potenza del test, a parità di tutte le altre condizioni?

La potenza \(1 - \beta\) aumenta quando: cresce \(n\) (distribuzioni più concentrate), cresce la dimensione dell'effetto reale (più facile da rilevare), diminuisce \(\sigma\) (misure più precise). Al contrario, abbassare \(\alpha\) da 0.05 a 0.01 rende il test più conservativo: la regione di rifiuto si restringe, aumenta la soglia che la statistica deve superare, e quindi aumenta \(\beta\) (errore di II tipo) e diminuisce la potenza. C'è quindi una relazione di compromesso tra \(\alpha\) e \(\beta\): a parità di \(n\) e \(\sigma\), ridurre \(\alpha\) aumenta \(\beta\) e viceversa. Questo è il trade-off fondamentale nella progettazione di uno studio.

  • False
  • False
  • True
  • False

Un ricercatore vuole calcolare la potenza di un test \(z\) unilaterale destro (\(H_0: \mu = 50\), \(H_1: \mu > 50\), \(\alpha = 0.05\)) con \(\sigma = 10\) e \(n = 25\), assumendo un effetto di dimensione media secondo Cohen (\(d = 0.50\)). Il primo passo è ricavare il valore \(\mu_1\) rispetto al quale calcolare la potenza, invertendo la formula della \(d\) di Cohen: \(d = (\mu_1 - \mu_0)/\sigma\). Qual è il valore corretto di \(\mu_1\)?

Invertendo la formula della \(d\) di Cohen, \(d = (\mu_1 - \mu_0)/\sigma\), si ricava \(\mu_1 = \mu_0 + d \cdot \sigma = 50 + 0.50 \times 10 = \mathbf{55}\). Questo è il valore della media alternativa rispetto alla quale calcolare la potenza: rappresenta la situazione in cui l'effetto nella popolazione è esattamente di dimensione media. Una volta noto \(\mu_1 = 55\), si calcola la regione critica sotto \(H_0\) (rifiuta se \(\bar{x} > 50 + 1.645 \cdot (10/5) = 53.29\)), si standardizza il valore critico sotto \(H_1\) (\(z_\beta = (53.29 - 55)/2 = -0.855\)), e si ottiene la potenza come \(1 - \beta = 1 - \Phi(-0.855) = \Phi(0.855) \approx 0.80\). Il valore 50.50 somma \(d\) direttamente a \(\mu_0\) senza moltiplicare per \(\sigma\). Il valore 5 è solo la differenza \(\delta = d \cdot \sigma\), dimenticando di aggiungerla a \(\mu_0\). Il valore 75 moltiplica \(\mu_0\) per \((1 + d)\) invece di aggiungere \(d \cdot \sigma\).

  • False
  • True
  • False
  • False

Un ricercatore vuole pianificare uno studio con potenza \(1 - \beta = 0.80\), \(\alpha = 0.05\) (test bilaterale) e si aspetta un effetto di dimensione piccola (\(d = 0.20\)) secondo Cohen. Rispetto a uno studio analogo con effetto medio (\(d = 0.50\)), come cambierà la numerosità campionaria necessaria?

La numerosità campionaria necessaria per raggiungere una data potenza è inversamente proporzionale al quadrato della dimensione dell'effetto: \(n \propto 1/d^2\). Con \(d = 0.20\) invece di \(d = 0.50\), il rapporto è \((0.50/0.20)^2 = 6.25\): servono circa 6 volte più osservazioni. In termini concreti, per un test bilaterale con \(\alpha = 0.05\) e potenza 0.80, un effetto medio richiede circa \(n = 200\) per gruppo, mentre un effetto piccolo ne richiede circa \(n = 790\) per gruppo. Effetti piccoli non sono "più facili" da rilevare: al contrario, richiedono campioni molto più grandi proprio perché il segnale è debole rispetto al rumore. La dimensione dell'effetto è un fattore determinante nel calcolo di \(n\), insieme a \(\alpha\) e \(\beta\).

  • False
  • False
  • False
  • True

Uno studio pilota su \(n = 15\) pazienti non trova un effetto significativo di una nuova psicoterapia (\(p = 0.21\), \(\alpha = 0.05\)). L'analisi della potenza a posteriori indica che, con \(n = 15\) e un effetto atteso di dimensione media (\(d = 0.50\)), la potenza era solo del 34%. Quale conclusione è corretta?

Con potenza del 34%, la probabilità di errore di II tipo era \(\beta = 1 - 0.34 = 0.66\): il 66% di probabilità di non rilevare un effetto reale di dimensione media. Il non-rifiuto di \(H_0\) è quindi poco informativo: non permette di distinguere tra "la terapia non funziona" e "il campione era troppo piccolo per rilevare l'effetto". Uno studio mal potenziato non fornisce evidenza convincente né a favore né contro l'efficacia della terapia. Concludere che la terapia è "sicuramente inefficace" è un errore logico: il non-rifiuto di \(H_0\) non equivale all'accettazione di \(H_0\). La potenza riguarda la distribuzione della statistica test, non la proporzione di pazienti che rispondono. La distanza di \(p\) da \(\alpha\) non modifica il problema della bassa potenza.

  • True
  • False
  • False
  • False