In uno studio, 80 su 200 donne (\(\hat{\pi}_1 = 0.40\)) e 60 su 300 uomini (\(\hat{\pi}_2 = 0.20\)) riferiscono sintomi d'ansia. Si verifica \(H_0: \pi_1 = \pi_2\) contro \(H_1: \pi_1 \neq \pi_2\) con \(\alpha = 0.05\). Sotto \(H_0\) si stima la proporzione comune \(\hat{\pi} = (80+60)/(200+300) = 0.28\). La statistica test è \(z = (\hat{\pi}_1 - \hat{\pi}_2)/\sqrt{\hat{\pi}(1-\hat{\pi})(1/n_1 + 1/n_2)}\). Dalla tavola: \(z_{0.025} = 1.96\). Qual è il valore di \(z\)?
Il denominatore è \(\sqrt{0.28 \times 0.72 \times (1/200 + 1/300)} = \sqrt{0.2016 \times 0.00833} = \sqrt{0.001680} \approx 0.04099\). La statistica test è \(z = (0.40 - 0.20)/0.04099 \approx \mathbf{4.97}\). Poiché \(|4.97| > 1.96\), si rifiuta \(H_0\): c'è evidenza di una differenza significativa tra le proporzioni. Il punto chiave è l'uso della proporzione pooled \(\hat{\pi}\) al denominatore, che combina i dati di entrambi i gruppi perché sotto \(H_0\) le due proporzioni sono uguali. Il valore 0.20 è la differenza grezza \(\hat{\pi}_1 - \hat{\pi}_2\) prima della standardizzazione. Il valore 2.50 si otterrebbe usando erroneamente \(\hat{\pi}_1(1-\hat{\pi}_1)/n_1 + \hat{\pi}_2(1-\hat{\pi}_2)/n_2\) al denominatore invece della proporzione pooled. Il valore 0.40 è la sola \(\hat{\pi}_1\).
Un ricercatore confronta i punteggi medi di benessere in tre gruppi terapeutici (\(k = 3\), \(n_{tot} = 30\)). La devianza totale è \(SS_{tot} = 500\), la devianza tra i gruppi è \(SS_{tra} = 200\) e la devianza entro i gruppi è \(SS_{entro} = 300\). Qual è il mean square tra i gruppi (\(MS_{tra}\)), usato come numeratore della statistica \(F\)?
Il mean square si ottiene dividendo la devianza per i rispettivi gradi di libertà. Per la variabilità tra i gruppi: \(df_{tra} = k - 1 = 3 - 1 = 2\), quindi \(MS_{tra} = SS_{tra}/df_{tra} = 200/2 = \mathbf{100}\). Analogamente, \(df_{entro} = n_{tot} - k = 30 - 3 = 27\), quindi \(MS_{entro} = 300/27 \approx 11.11\). La statistica \(F = MS_{tra}/MS_{entro} = 100/11.11 \approx 9.00\). Il valore 200 è la devianza grezza \(SS_{tra}\), prima della divisione per i gradi di libertà. Il valore 66.67 si otterrebbe dividendo \(SS_{tra}\) per \(k = 3\) invece che per \(k-1 = 2\). Il valore 10 si otterrebbe dividendo \(SS_{tra}\) per \(df_{entro} = 20\) (errato) oppure per \(n_{tot}/k = 10\).
In un'ANOVA a un fattore con \(k = 4\) gruppi e \(n_{tot} = 40\) osservazioni, si ottiene \(MS_{tra} = 60\) e \(MS_{entro} = 15\). Il valore critico dalla tavola \(F\) con \(df_1 = 3\) e \(df_2 = 36\) è \(F_{0.05;\, 3,\, 36} = 2.87\). Qual è la statistica \(F\) e la decisione corretta?
La statistica \(F = MS_{tra}/MS_{entro} = 60/15 = \mathbf{4.00}\), con \(df_1 = k-1 = 3\) e \(df_2 = n_{tot}-k = 36\) gradi di libertà. Poiché \(4.00 > F_{0.05;\, 3,\, 36} = 2.87\), si rifiuta \(H_0\): c'è evidenza che almeno una coppia di medie differisce. Il test \(F\) nell'ANOVA è unilaterale destro: si rifiuta solo per valori grandi di \(F\), perché valori piccoli indicano che la variabilità tra gruppi non supera quella entro i gruppi. La seconda opzione confronta \(F\) con 1 (il valore atteso sotto \(H_0\)): non è la regola di decisione corretta. La terza inverte il rapporto. La quarta confronta \(F\) con \(\alpha\).
Prima di raccogliere i dati, un ricercatore formula l'ipotesi teorica che il gruppo di terapia cognitivo-comportamentale avrà una media significativamente diversa dal gruppo di controllo, indipendentemente dagli altri gruppi. Quale tipo di confronto sta pianificando?
I confronti pianificati (o a priori) sono ipotesi specifiche formulate prima della raccolta dei dati sulla base di ragioni teoriche: il ricercatore non sta cercando tra tutti i possibili confronti, ma testando una previsione specifica. Questo li distingue dai confronti post-hoc (a posteriori), che vengono decisi dopo aver visto i dati, spesso scegliendo le coppie con le differenze maggiori. I confronti pianificati richiedono una correzione meno severa (o nessuna, se sono pochi e ortogonali), proprio perché il numero di confronti era fissato a priori. I confronti post-hoc richiedono correzioni più conservative (Bonferroni, Tukey, ecc.) per controllare l'errore di I tipo nell'intera famiglia. La correzione di Bonferroni per tutti i confronti possibili si applica ai post-hoc, non ai confronti pianificati specifici.
Un'ANOVA con \(k = 4\) gruppi risulta significativa. Il ricercatore vuole confrontare tutte le coppie di medie usando la correzione di Bonferroni con \(\alpha_{fam} = 0.05\). Quanti confronti a coppie esistono e qual è il livello \(\alpha\) corretto per ciascuno?
Con \(k = 4\) gruppi, il numero di confronti a coppie possibili è \(\binom{4}{2} = 4!/(2! \cdot 2!) = \mathbf{6}\). La correzione di Bonferroni divide il livello di significatività familiare \(\alpha_{fam}\) per il numero di confronti \(m\): \(\alpha_{per\,confronto} = \alpha_{fam}/m = 0.05/6 \approx \mathbf{0.0083}\). Questo controllo garantisce che la probabilità di commettere almeno un errore di I tipo nell'intera famiglia di confronti non superi \(\alpha_{fam} = 0.05\). La seconda opzione usa \(m = k = 4\) (numero di gruppi) invece del numero di coppie. La terza conta correttamente 6 confronti ma poi divide per 4. La quarta conta solo 3 confronti, come se ci fossero 3 gruppi.
Da un campione di \(n = 100\) studenti universitari si calcola \(\bar{x} = 72\) su un test di autoefficacia. La deviazione standard della popolazione è \(\sigma = 10\) (nota). L'intervallo di confidenza al 95% per \(\mu\) è costruito come \(\bar{x} \pm z_{0.025} \cdot \sigma/\sqrt{n}\). Quale delle seguenti affermazioni interpreta correttamente l'intervallo ottenuto \([70.04,\ 73.96]\)?
L'interpretazione corretta degli intervalli di confidenza è frequentista: il 95% si riferisce alla procedura, non all'intervallo specifico ottenuto. Se si ripetesse il campionamento molte volte e si costruisse ogni volta un IC al 95%, il 95% di questi intervalli conterrebbe il vero \(\mu\). Per questo intervallo specifico, \(\mu\) ci sta dentro oppure no (non ha senso dire che c'è il 95% di probabilità). Affermare che "c'è il 95% di probabilità che \(\mu \in [70.04, 73.96]\)" è l'errore più comune e più pericoloso: attribuisce probabilità a un parametro fisso (seppur ignoto), interpretazione bayesiana non giustificata in questo framework. Le ultime due opzioni confondono l'IC con una banda di distribuzione dei dati.
Un ricercatore calcola un intervallo di confidenza al 95% per \(\mu\) e ottiene \([52.3,\ 67.8]\). Vuole poi verificare \(H_0: \mu = 50\) contro \(H_1: \mu \neq 50\) con \(\alpha = 0.05\). Senza eseguire il test, cosa può concludere dall'IC?
Esiste una dualità tra l'intervallo di confidenza al livello \((1-\alpha)\) e il test bilaterale al livello \(\alpha\): un valore \(\mu_0\) viene rifiutato dal test se e solo se non è contenuto nell'IC. Poiché \(\mu_0 = 50\) non è nell'intervallo \([52.3,\ 67.8]\), il test bilaterale con \(\alpha = 0.05\) rigetta \(H_0: \mu = 50\). La seconda opzione nega questa dualità. La terza confonde significatività statistica con rilevanza clinica: che l'IC sia interamente sopra 50 indica la direzione dell'effetto, ma non ne determina la rilevanza pratica. La quarta ignora la dualità IC-test: calcolare la statistica porterebbe allo stesso risultato che si ottiene leggendo l'IC.
In uno studio, la covarianza tra ore di studio settimanali (\(X\)) e punteggio all'esame (\(Y\)) è \(\text{Cov}(X,Y) = 18\), con \(\sigma_X = 3\) e \(\sigma_Y = 9\). Qual è il coefficiente di correlazione di Pearson \(r_{XY}\)?
Il coefficiente di correlazione di Pearson standardizza la covarianza dividendo per il prodotto delle deviazioni standard: \(r_{XY} = \text{Cov}(X,Y)/(\sigma_X \cdot \sigma_Y) = 18/(3 \times 9) = 18/27 = \mathbf{0.667}\). Questa standardizzazione rende \(r\) adimensionale e limitato a \([-1, 1]\), consentendo confronti tra studi con scale diverse. Il valore 18 è la covarianza grezza: dipende dalle unità di misura di \(X\) e \(Y\) ed è quindi difficile da interpretare direttamente. Il valore 0.056 divide per \(\sigma_X^2 \cdot \sigma_Y^2 = 729\) invece che per \(\sigma_X \cdot \sigma_Y = 27\). Il valore 2 divide la covarianza per la sola \(\sigma_X\), dimenticando \(\sigma_Y\).
Su un campione di \(n = 27\) studenti si osserva una correlazione \(r = 0.40\) tra ansia da esame e voto. Si vuole verificare \(H_0: \rho = 0\) contro \(H_1: \rho \neq 0\) con \(\alpha = 0.05\). La statistica test è \(t = r\sqrt{n-2}/\sqrt{1-r^2}\). Il valore critico è \(t_{0.025,\, 25} = 2.060\). Qual è la statistica \(t\) e la decisione?
La statistica test è \(t = r\sqrt{n-2}/\sqrt{1-r^2} = 0.40\sqrt{25}/\sqrt{1-0.16} = 0.40 \times 5/\sqrt{0.84} = 2.00/0.9165 \approx \mathbf{2.19}\), con \(\nu = n-2 = 25\) gradi di libertà. Poiché \(|2.19| > t_{0.025,25} = 2.060\), si rifiuta \(H_0\): c'è evidenza di una correlazione lineare significativa tra ansia e voto. I gradi di libertà sono \(n-2\) perché nella regressione lineare semplice si stimano due parametri (\(\beta_0\) e \(\beta_1\)). La seconda opzione usa \(r\) come soglia di decisione invece dei valori critici: \(r = 0.40\) non è direttamente confrontabile con \(\alpha\). La terza confonde \(r\) con la statistica \(t\). La quarta inverte la regola: \(|t| > 2.060\) porta al rifiuto, non al non rifiuto.
In una tabella \(2 \times 2\) che incrocia genere (M/F) e presenza di disturbi d'ansia (Sì/No) su \(n = 200\) soggetti, la frequenza osservata per la cella "Femmine con ansia" è \(O = 40\), mentre la frequenza attesa sotto \(H_0\) di indipendenza è \(E = 30\). Qual è il contributo di questa cella alla statistica \(\chi^2\)?
Il contributo di ciascuna cella alla statistica \(\chi^2\) è \((O - E)^2/E = (40-30)^2/30 = 100/30 = \mathbf{3.33}\). La statistica totale \(\chi^2 = \sum (O-E)^2/E\) somma questi contributi su tutte le celle. Sotto \(H_0\) di indipendenza, \(\chi^2\) segue asintoticamente una distribuzione chi-quadrato con \((r-1)(c-1)\) gradi di libertà, dove \(r\) e \(c\) sono il numero di righe e colonne. Il valore 10 è la sola differenza \(O - E = 40 - 30\) prima dell'elevamento a quadrato e della divisione. Il valore 0.33 inverte il rapporto: \(E/O\) invece di \((O-E)^2/E\). Il valore 1.33 usa \(|O-E|/E\) invece di \((O-E)^2/E\).
In una tabella \(3 \times 4\) con \(n = 120\) soggetti si ottiene \(\chi^2 = 18\). Qual è il valore della V di Cramér?
La V di Cramér normalizza il \(\chi^2\) tenendo conto sia della numerosità sia delle dimensioni della tabella: \(V = \sqrt{\chi^2 / (n \cdot \min(r-1,\, c-1))}\). Con \(r = 3\) righe e \(c = 4\) colonne: \(\min(r-1, c-1) = \min(2, 3) = 2\). Quindi \(V = \sqrt{18/(120 \times 2)} = \sqrt{18/240} = \sqrt{0.075} \approx \mathbf{0.274}\). A differenza del \(\chi^2\) grezzo, \(V \in [0, 1]\) ed è interpretabile come misura di associazione indipendente da \(n\) e dalle dimensioni della tabella. Il valore 0.150 usa \(\min(r,c) = 3\) invece di \(\min(r-1,c-1) = 2\). Il valore 18 è il \(\chi^2\) grezzo, non normalizzato. Il valore 0.387 usa \(n\) senza moltiplicare per \(\min(r-1,c-1)\): è il \(\phi = \sqrt{\chi^2/n}\), valido solo per tabelle \(2 \times 2\).
Un ricercatore verifica se i 120 pazienti di un reparto si distribuiscono uniformemente tra 4 diagnosi principali. Le frequenze osservate sono: \(O_1 = 40\), \(O_2 = 25\), \(O_3 = 35\), \(O_4 = 20\). Sotto \(H_0\) di distribuzione uniforme, quante osservazioni ci si aspetta per ciascuna categoria?
Nel test di adattamento (\(\chi^2\) goodness-of-fit), si confronta la distribuzione osservata con quella teorica ipotizzata da \(H_0\). Sotto \(H_0\) di distribuzione uniforme con \(k = 4\) categorie e \(n = 120\) osservazioni, la frequenza attesa per ciascuna categoria è \(E_i = n/k = 120/4 = \mathbf{30}\). La statistica test è poi \(\chi^2 = \sum_{i=1}^4 (O_i - E_i)^2/E_i = (40-30)^2/30 + (25-30)^2/30 + (35-30)^2/30 + (20-30)^2/30 = 100/30 + 25/30 + 25/30 + 100/30 = 8.33\), con \(\nu = k-1 = 3\) gradi di libertà. Il valore 120 è l'intera numerosità campionaria. Usare le frequenze osservate come attese renderebbe \(\chi^2 = 0\) per definizione: il test non avrebbe senso. Il valore 4 è il numero di categorie, non la frequenza attesa.
In una regressione lineare semplice tra ore di terapia (\(X\)) e riduzione dei sintomi (\(Y\)), si ottiene \(\hat{\beta}_0 = 5\) e \(\hat{\beta}_1 = 2.5\). Qual è l'interpretazione corretta di \(\hat{\beta}_1 = 2.5\)?
Il coefficiente angolare \(\hat{\beta}_1\) rappresenta la variazione attesa di \(Y\) per un incremento unitario di \(X\): per ogni ora aggiuntiva di terapia, la riduzione attesa dei sintomi aumenta di 2.5 punti. È l'interpretazione centrale della regressione lineare. Il valore dell'intercetta \(\hat{\beta}_0 = 5\) rappresenta il valore atteso di \(Y\) quando \(X = 0\) (assenza di terapia): la riduzione attesa dei sintomi è 5 punti anche senza terapia (interpretabile solo se \(X = 0\) è un valore plausibile). Il 2.5% della varianza descriverebbe \(R^2\), non \(\hat{\beta}_1\). La correlazione è un concetto distinto e non coincide con \(\hat{\beta}_1\) (anche se i due hanno lo stesso segno).
In un modello di regressione lineare semplice, la devianza totale di \(Y\) è \(SS_{tot} = 400\) e la devianza residua (non spiegata) è \(SS_{res} = 100\). Qual è il valore di \(R^2\) e come si interpreta?
\(R^2 = SS_{reg}/SS_{tot} = (SS_{tot} - SS_{res})/SS_{tot} = (400-100)/400 = 300/400 = \mathbf{0.75}\). L'indice \(R^2 \in [0,1]\) misura la proporzione di variabilità di \(Y\) spiegata dalla relazione lineare con \(X\): qui il modello spiega il 75% della varianza totale. Il complemento \(1 - R^2 = 0.25\) è la proporzione residua (non spiegata). Il valore 0.25 è \(SS_{res}/SS_{tot}\): è la quota di varianza non spiegata, non quella spiegata. Il valore 4 è il rapporto \(SS_{tot}/SS_{res}\), privo di interpretazione diretta come bontà di adattamento. Il valore 300 è la devianza spiegata \(SS_{reg}\) in valore assoluto: non è normalizzata e dipende dalla scala di \(Y\).
In un modello di regressione lineare semplice su \(n = 30\) osservazioni, si ottiene \(\hat{\beta}_1 = 3.2\) con errore standard \(SE(\hat{\beta}_1) = 1.4\). Si verifica \(H_0: \beta_1 = 0\) contro \(H_1: \beta_1 \neq 0\) con \(\alpha = 0.05\). Il valore critico è \(t_{0.025,\, 28} = 2.048\). Qual è la statistica \(t\) e la decisione?
La statistica test per \(H_0: \beta_1 = 0\) è \(t = \hat{\beta}_1/SE(\hat{\beta}_1) = 3.2/1.4 \approx \mathbf{2.29}\), con \(\nu = n-2 = 28\) gradi di libertà (si perdono 2 gradi di libertà per la stima di \(\beta_0\) e \(\beta_1\)). Poiché \(|2.29| > t_{0.025,28} = 2.048\), si rifiuta \(H_0\): c'è evidenza che la pendenza sia diversa da zero, cioè che \(X\) abbia un effetto lineare significativo su \(Y\). La seconda opzione commette l'errore di valutare il segno di \(\hat{\beta}_1\) invece di testarne la significatività. La terza inverte il rapporto: \(SE/\hat{\beta}_1 = 1.4/3.2 = 0.44\). La quarta confronta \(t\) con \(\alpha\).
In un modello di regressione multipla, il benessere psicologico (\(Y\)) viene predetto da ore di sonno (\(X_1\)) e livello di stress (\(X_2\)): \(\hat{Y} = 10 + 2.1X_1 - 1.8X_2\). Come si interpreta correttamente \(\hat{\beta}_1 = 2.1\)?
Nella regressione multipla, ciascun coefficiente \(\hat{\beta}_j\) è un effetto parziale: rappresenta la variazione attesa di \(Y\) per un incremento unitario di \(X_j\), tenendo costanti tutti gli altri predittori. Quindi \(\hat{\beta}_1 = 2.1\) significa che, a parità di livello di stress (\(X_2\) fissato), ogni ora aggiuntiva di sonno è associata a un aumento atteso di 2.1 punti nel benessere. Questo è il punto cruciale che distingue la regressione multipla da quella semplice: il coefficiente misura l'effetto di \(X_1\) al netto dell'effetto di \(X_2\). Nella regressione semplice (senza \(X_2\)) il coefficiente di \(X_1\) sarebbe diverso, perché includerebbe anche la parte di effetto mediata da \(X_2\).