In uno studio, 80 su 200 donne (\(\hat{\pi}_1 = 0.40\)) e 60 su 300 uomini (\(\hat{\pi}_2 = 0.20\)) riferiscono sintomi d'ansia. Si verifica \(H_0: \pi_1 = \pi_2\) contro \(H_1: \pi_1 \neq \pi_2\) con \(\alpha = 0.05\). Sotto \(H_0\) si stima la proporzione comune \(\hat{\pi} = (80+60)/(200+300) = 0.28\). La statistica test è \(z = (\hat{\pi}_1 - \hat{\pi}_2)/\sqrt{\hat{\pi}(1-\hat{\pi})(1/n_1 + 1/n_2)}\). Dalla tavola: \(z_{0.025} = 1.96\). Qual è il valore di \(z\)?

Il denominatore è \(\sqrt{0.28 \times 0.72 \times (1/200 + 1/300)} = \sqrt{0.2016 \times 0.00833} = \sqrt{0.001680} \approx 0.04099\). La statistica test è \(z = (0.40 - 0.20)/0.04099 \approx \mathbf{4.97}\). Poiché \(|4.97| > 1.96\), si rifiuta \(H_0\): c'è evidenza di una differenza significativa tra le proporzioni. Il punto chiave è l'uso della proporzione pooled \(\hat{\pi}\) al denominatore, che combina i dati di entrambi i gruppi perché sotto \(H_0\) le due proporzioni sono uguali. Il valore 0.20 è la differenza grezza \(\hat{\pi}_1 - \hat{\pi}_2\) prima della standardizzazione. Il valore 2.50 si otterrebbe usando erroneamente \(\hat{\pi}_1(1-\hat{\pi}_1)/n_1 + \hat{\pi}_2(1-\hat{\pi}_2)/n_2\) al denominatore invece della proporzione pooled. Il valore 0.40 è la sola \(\hat{\pi}_1\).

  • False
  • True
  • False
  • False

Un ricercatore confronta i punteggi medi di benessere in tre gruppi terapeutici (\(k = 3\), \(n_{tot} = 30\)). La devianza totale è \(SS_{tot} = 500\), la devianza tra i gruppi è \(SS_{tra} = 200\) e la devianza entro i gruppi è \(SS_{entro} = 300\). Qual è il mean square tra i gruppi (\(MS_{tra}\)), usato come numeratore della statistica \(F\)?

Il mean square si ottiene dividendo la devianza per i rispettivi gradi di libertà. Per la variabilità tra i gruppi: \(df_{tra} = k - 1 = 3 - 1 = 2\), quindi \(MS_{tra} = SS_{tra}/df_{tra} = 200/2 = \mathbf{100}\). Analogamente, \(df_{entro} = n_{tot} - k = 30 - 3 = 27\), quindi \(MS_{entro} = 300/27 \approx 11.11\). La statistica \(F = MS_{tra}/MS_{entro} = 100/11.11 \approx 9.00\). Il valore 200 è la devianza grezza \(SS_{tra}\), prima della divisione per i gradi di libertà. Il valore 66.67 si otterrebbe dividendo \(SS_{tra}\) per \(k = 3\) invece che per \(k-1 = 2\). Il valore 10 si otterrebbe dividendo \(SS_{tra}\) per \(df_{entro} = 20\) (errato) oppure per \(n_{tot}/k = 10\).

  • False
  • False
  • False
  • True

In un'ANOVA a un fattore con \(k = 4\) gruppi e \(n_{tot} = 40\) osservazioni, si ottiene \(MS_{tra} = 60\) e \(MS_{entro} = 15\). Il valore critico dalla tavola \(F\) con \(df_1 = 3\) e \(df_2 = 36\) è \(F_{0.05;\, 3,\, 36} = 2.87\). Qual è la statistica \(F\) e la decisione corretta?

La statistica \(F = MS_{tra}/MS_{entro} = 60/15 = \mathbf{4.00}\), con \(df_1 = k-1 = 3\) e \(df_2 = n_{tot}-k = 36\) gradi di libertà. Poiché \(4.00 > F_{0.05;\, 3,\, 36} = 2.87\), si rifiuta \(H_0\): c'è evidenza che almeno una coppia di medie differisce. Il test \(F\) nell'ANOVA è unilaterale destro: si rifiuta solo per valori grandi di \(F\), perché valori piccoli indicano che la variabilità tra gruppi non supera quella entro i gruppi. La seconda opzione confronta \(F\) con 1 (il valore atteso sotto \(H_0\)): non è la regola di decisione corretta. La terza inverte il rapporto. La quarta confronta \(F\) con \(\alpha\).

  • False
  • False
  • False
  • True

Prima di raccogliere i dati, un ricercatore formula l'ipotesi teorica che il gruppo di terapia cognitivo-comportamentale avrà una media significativamente diversa dal gruppo di controllo, indipendentemente dagli altri gruppi. Quale tipo di confronto sta pianificando?

I confronti pianificati (o a priori) sono ipotesi specifiche formulate prima della raccolta dei dati sulla base di ragioni teoriche: il ricercatore non sta cercando tra tutti i possibili confronti, ma testando una previsione specifica. Questo li distingue dai confronti post-hoc (a posteriori), che vengono decisi dopo aver visto i dati, spesso scegliendo le coppie con le differenze maggiori. I confronti pianificati richiedono una correzione meno severa (o nessuna, se sono pochi e ortogonali), proprio perché il numero di confronti era fissato a priori. I confronti post-hoc richiedono correzioni più conservative (Bonferroni, Tukey, ecc.) per controllare l'errore di I tipo nell'intera famiglia. La correzione di Bonferroni per tutti i confronti possibili si applica ai post-hoc, non ai confronti pianificati specifici.

  • True
  • False
  • False
  • False

Un'ANOVA con \(k = 4\) gruppi risulta significativa. Il ricercatore vuole confrontare tutte le coppie di medie usando la correzione di Bonferroni con \(\alpha_{fam} = 0.05\). Quanti confronti a coppie esistono e qual è il livello \(\alpha\) corretto per ciascuno?

Con \(k = 4\) gruppi, il numero di confronti a coppie possibili è \(\binom{4}{2} = 4!/(2! \cdot 2!) = \mathbf{6}\). La correzione di Bonferroni divide il livello di significatività familiare \(\alpha_{fam}\) per il numero di confronti \(m\): \(\alpha_{per\,confronto} = \alpha_{fam}/m = 0.05/6 \approx \mathbf{0.0083}\). Questo controllo garantisce che la probabilità di commettere almeno un errore di I tipo nell'intera famiglia di confronti non superi \(\alpha_{fam} = 0.05\). La seconda opzione usa \(m = k = 4\) (numero di gruppi) invece del numero di coppie. La terza conta correttamente 6 confronti ma poi divide per 4. La quarta conta solo 3 confronti, come se ci fossero 3 gruppi.

  • False
  • False
  • False
  • True

Da un campione di \(n = 100\) studenti universitari si calcola \(\bar{x} = 72\) su un test di autoefficacia. La deviazione standard della popolazione è \(\sigma = 10\) (nota). L'intervallo di confidenza al 95% per \(\mu\) è costruito come \(\bar{x} \pm z_{0.025} \cdot \sigma/\sqrt{n}\). Quale delle seguenti affermazioni interpreta correttamente l'intervallo ottenuto \([70.04,\ 73.96]\)?

L'interpretazione corretta degli intervalli di confidenza è frequentista: il 95% si riferisce alla procedura, non all'intervallo specifico ottenuto. Se si ripetesse il campionamento molte volte e si costruisse ogni volta un IC al 95%, il 95% di questi intervalli conterrebbe il vero \(\mu\). Per questo intervallo specifico, \(\mu\) ci sta dentro oppure no (non ha senso dire che c'è il 95% di probabilità). Affermare che "c'è il 95% di probabilità che \(\mu \in [70.04, 73.96]\)" è l'errore più comune e più pericoloso: attribuisce probabilità a un parametro fisso (seppur ignoto), interpretazione bayesiana non giustificata in questo framework. Le ultime due opzioni confondono l'IC con una banda di distribuzione dei dati.

  • True
  • False
  • False
  • False

Un ricercatore calcola un intervallo di confidenza al 95% per \(\mu\) e ottiene \([52.3,\ 67.8]\). Vuole poi verificare \(H_0: \mu = 50\) contro \(H_1: \mu \neq 50\) con \(\alpha = 0.05\). Senza eseguire il test, cosa può concludere dall'IC?

Esiste una dualità tra l'intervallo di confidenza al livello \((1-\alpha)\) e il test bilaterale al livello \(\alpha\): un valore \(\mu_0\) viene rifiutato dal test se e solo se non è contenuto nell'IC. Poiché \(\mu_0 = 50\) non è nell'intervallo \([52.3,\ 67.8]\), il test bilaterale con \(\alpha = 0.05\) rigetta \(H_0: \mu = 50\). La seconda opzione nega questa dualità. La terza confonde significatività statistica con rilevanza clinica: che l'IC sia interamente sopra 50 indica la direzione dell'effetto, ma non ne determina la rilevanza pratica. La quarta ignora la dualità IC-test: calcolare la statistica porterebbe allo stesso risultato che si ottiene leggendo l'IC.

  • False
  • False
  • False
  • True

In uno studio, la covarianza tra ore di studio settimanali (\(X\)) e punteggio all'esame (\(Y\)) è \(\text{Cov}(X,Y) = 18\), con \(\sigma_X = 3\) e \(\sigma_Y = 9\). Qual è il coefficiente di correlazione di Pearson \(r_{XY}\)?

Il coefficiente di correlazione di Pearson standardizza la covarianza dividendo per il prodotto delle deviazioni standard: \(r_{XY} = \text{Cov}(X,Y)/(\sigma_X \cdot \sigma_Y) = 18/(3 \times 9) = 18/27 = \mathbf{0.667}\). Questa standardizzazione rende \(r\) adimensionale e limitato a \([-1, 1]\), consentendo confronti tra studi con scale diverse. Il valore 18 è la covarianza grezza: dipende dalle unità di misura di \(X\) e \(Y\) ed è quindi difficile da interpretare direttamente. Il valore 0.056 divide per \(\sigma_X^2 \cdot \sigma_Y^2 = 729\) invece che per \(\sigma_X \cdot \sigma_Y = 27\). Il valore 2 divide la covarianza per la sola \(\sigma_X\), dimenticando \(\sigma_Y\).

  • False
  • False
  • True
  • False

Su un campione di \(n = 27\) studenti si osserva una correlazione \(r = 0.40\) tra ansia da esame e voto. Si vuole verificare \(H_0: \rho = 0\) contro \(H_1: \rho \neq 0\) con \(\alpha = 0.05\). La statistica test è \(t = r\sqrt{n-2}/\sqrt{1-r^2}\). Il valore critico è \(t_{0.025,\, 25} = 2.060\). Qual è la statistica \(t\) e la decisione?

La statistica test è \(t = r\sqrt{n-2}/\sqrt{1-r^2} = 0.40\sqrt{25}/\sqrt{1-0.16} = 0.40 \times 5/\sqrt{0.84} = 2.00/0.9165 \approx \mathbf{2.19}\), con \(\nu = n-2 = 25\) gradi di libertà. Poiché \(|2.19| > t_{0.025,25} = 2.060\), si rifiuta \(H_0\): c'è evidenza di una correlazione lineare significativa tra ansia e voto. I gradi di libertà sono \(n-2\) perché nella regressione lineare semplice si stimano due parametri (\(\beta_0\) e \(\beta_1\)). La seconda opzione usa \(r\) come soglia di decisione invece dei valori critici: \(r = 0.40\) non è direttamente confrontabile con \(\alpha\). La terza confonde \(r\) con la statistica \(t\). La quarta inverte la regola: \(|t| > 2.060\) porta al rifiuto, non al non rifiuto.

  • True
  • False
  • False
  • False

In una tabella \(2 \times 2\) che incrocia genere (M/F) e presenza di disturbi d'ansia (Sì/No) su \(n = 200\) soggetti, la frequenza osservata per la cella "Femmine con ansia" è \(O = 40\), mentre la frequenza attesa sotto \(H_0\) di indipendenza è \(E = 30\). Qual è il contributo di questa cella alla statistica \(\chi^2\)?

Il contributo di ciascuna cella alla statistica \(\chi^2\) è \((O - E)^2/E = (40-30)^2/30 = 100/30 = \mathbf{3.33}\). La statistica totale \(\chi^2 = \sum (O-E)^2/E\) somma questi contributi su tutte le celle. Sotto \(H_0\) di indipendenza, \(\chi^2\) segue asintoticamente una distribuzione chi-quadrato con \((r-1)(c-1)\) gradi di libertà, dove \(r\) e \(c\) sono il numero di righe e colonne. Il valore 10 è la sola differenza \(O - E = 40 - 30\) prima dell'elevamento a quadrato e della divisione. Il valore 0.33 inverte il rapporto: \(E/O\) invece di \((O-E)^2/E\). Il valore 1.33 usa \(|O-E|/E\) invece di \((O-E)^2/E\).

  • True
  • False
  • False
  • False

In una tabella \(3 \times 4\) con \(n = 120\) soggetti si ottiene \(\chi^2 = 18\). Qual è il valore della V di Cramér?

La V di Cramér normalizza il \(\chi^2\) tenendo conto sia della numerosità sia delle dimensioni della tabella: \(V = \sqrt{\chi^2 / (n \cdot \min(r-1,\, c-1))}\). Con \(r = 3\) righe e \(c = 4\) colonne: \(\min(r-1, c-1) = \min(2, 3) = 2\). Quindi \(V = \sqrt{18/(120 \times 2)} = \sqrt{18/240} = \sqrt{0.075} \approx \mathbf{0.274}\). A differenza del \(\chi^2\) grezzo, \(V \in [0, 1]\) ed è interpretabile come misura di associazione indipendente da \(n\) e dalle dimensioni della tabella. Il valore 0.150 usa \(\min(r,c) = 3\) invece di \(\min(r-1,c-1) = 2\). Il valore 18 è il \(\chi^2\) grezzo, non normalizzato. Il valore 0.387 usa \(n\) senza moltiplicare per \(\min(r-1,c-1)\): è il \(\phi = \sqrt{\chi^2/n}\), valido solo per tabelle \(2 \times 2\).

  • False
  • False
  • False
  • True

Un ricercatore verifica se i 120 pazienti di un reparto si distribuiscono uniformemente tra 4 diagnosi principali. Le frequenze osservate sono: \(O_1 = 40\), \(O_2 = 25\), \(O_3 = 35\), \(O_4 = 20\). Sotto \(H_0\) di distribuzione uniforme, quante osservazioni ci si aspetta per ciascuna categoria?

Nel test di adattamento (\(\chi^2\) goodness-of-fit), si confronta la distribuzione osservata con quella teorica ipotizzata da \(H_0\). Sotto \(H_0\) di distribuzione uniforme con \(k = 4\) categorie e \(n = 120\) osservazioni, la frequenza attesa per ciascuna categoria è \(E_i = n/k = 120/4 = \mathbf{30}\). La statistica test è poi \(\chi^2 = \sum_{i=1}^4 (O_i - E_i)^2/E_i = (40-30)^2/30 + (25-30)^2/30 + (35-30)^2/30 + (20-30)^2/30 = 100/30 + 25/30 + 25/30 + 100/30 = 8.33\), con \(\nu = k-1 = 3\) gradi di libertà. Il valore 120 è l'intera numerosità campionaria. Usare le frequenze osservate come attese renderebbe \(\chi^2 = 0\) per definizione: il test non avrebbe senso. Il valore 4 è il numero di categorie, non la frequenza attesa.

  • False
  • False
  • False
  • True

In una regressione lineare semplice tra ore di terapia (\(X\)) e riduzione dei sintomi (\(Y\)), si ottiene \(\hat{\beta}_0 = 5\) e \(\hat{\beta}_1 = 2.5\). Qual è l'interpretazione corretta di \(\hat{\beta}_1 = 2.5\)?

Il coefficiente angolare \(\hat{\beta}_1\) rappresenta la variazione attesa di \(Y\) per un incremento unitario di \(X\): per ogni ora aggiuntiva di terapia, la riduzione attesa dei sintomi aumenta di 2.5 punti. È l'interpretazione centrale della regressione lineare. Il valore dell'intercetta \(\hat{\beta}_0 = 5\) rappresenta il valore atteso di \(Y\) quando \(X = 0\) (assenza di terapia): la riduzione attesa dei sintomi è 5 punti anche senza terapia (interpretabile solo se \(X = 0\) è un valore plausibile). Il 2.5% della varianza descriverebbe \(R^2\), non \(\hat{\beta}_1\). La correlazione è un concetto distinto e non coincide con \(\hat{\beta}_1\) (anche se i due hanno lo stesso segno).

  • False
  • False
  • True
  • False

In un modello di regressione lineare semplice, la devianza totale di \(Y\) è \(SS_{tot} = 400\) e la devianza residua (non spiegata) è \(SS_{res} = 100\). Qual è il valore di \(R^2\) e come si interpreta?

\(R^2 = SS_{reg}/SS_{tot} = (SS_{tot} - SS_{res})/SS_{tot} = (400-100)/400 = 300/400 = \mathbf{0.75}\). L'indice \(R^2 \in [0,1]\) misura la proporzione di variabilità di \(Y\) spiegata dalla relazione lineare con \(X\): qui il modello spiega il 75% della varianza totale. Il complemento \(1 - R^2 = 0.25\) è la proporzione residua (non spiegata). Il valore 0.25 è \(SS_{res}/SS_{tot}\): è la quota di varianza non spiegata, non quella spiegata. Il valore 4 è il rapporto \(SS_{tot}/SS_{res}\), privo di interpretazione diretta come bontà di adattamento. Il valore 300 è la devianza spiegata \(SS_{reg}\) in valore assoluto: non è normalizzata e dipende dalla scala di \(Y\).

  • True
  • False
  • False
  • False

In un modello di regressione lineare semplice su \(n = 30\) osservazioni, si ottiene \(\hat{\beta}_1 = 3.2\) con errore standard \(SE(\hat{\beta}_1) = 1.4\). Si verifica \(H_0: \beta_1 = 0\) contro \(H_1: \beta_1 \neq 0\) con \(\alpha = 0.05\). Il valore critico è \(t_{0.025,\, 28} = 2.048\). Qual è la statistica \(t\) e la decisione?

La statistica test per \(H_0: \beta_1 = 0\) è \(t = \hat{\beta}_1/SE(\hat{\beta}_1) = 3.2/1.4 \approx \mathbf{2.29}\), con \(\nu = n-2 = 28\) gradi di libertà (si perdono 2 gradi di libertà per la stima di \(\beta_0\) e \(\beta_1\)). Poiché \(|2.29| > t_{0.025,28} = 2.048\), si rifiuta \(H_0\): c'è evidenza che la pendenza sia diversa da zero, cioè che \(X\) abbia un effetto lineare significativo su \(Y\). La seconda opzione commette l'errore di valutare il segno di \(\hat{\beta}_1\) invece di testarne la significatività. La terza inverte il rapporto: \(SE/\hat{\beta}_1 = 1.4/3.2 = 0.44\). La quarta confronta \(t\) con \(\alpha\).

  • False
  • False
  • True
  • False

In un modello di regressione multipla, il benessere psicologico (\(Y\)) viene predetto da ore di sonno (\(X_1\)) e livello di stress (\(X_2\)): \(\hat{Y} = 10 + 2.1X_1 - 1.8X_2\). Come si interpreta correttamente \(\hat{\beta}_1 = 2.1\)?

Nella regressione multipla, ciascun coefficiente \(\hat{\beta}_j\) è un effetto parziale: rappresenta la variazione attesa di \(Y\) per un incremento unitario di \(X_j\), tenendo costanti tutti gli altri predittori. Quindi \(\hat{\beta}_1 = 2.1\) significa che, a parità di livello di stress (\(X_2\) fissato), ogni ora aggiuntiva di sonno è associata a un aumento atteso di 2.1 punti nel benessere. Questo è il punto cruciale che distingue la regressione multipla da quella semplice: il coefficiente misura l'effetto di \(X_1\) al netto dell'effetto di \(X_2\). Nella regressione semplice (senza \(X_2\)) il coefficiente di \(X_1\) sarebbe diverso, perché includerebbe anche la parte di effetto mediata da \(X_2\).

  • True
  • False
  • False
  • False