La dimensione dell'effetto quantifica la rilevanza pratica di una differenza, indipendentemente dalla significatività statistica. Per il confronto tra due medie, Cohen definisce \(d = |\mu_1 - \mu_2|/\sigma\). Quali sono le soglie convenzionali proposte da Cohen per classificare la dimensione dell'effetto come piccola, media e grande?

Cohen (1988) propose soglie convenzionali per la \(d\) di Cohen nel confronto tra medie: \(d = 0.2\) (piccola), \(d = 0.5\) (media), \(d = 0.8\) (grande). Queste soglie sono state derivate empiricamente da una revisione della letteratura delle scienze sociali e comportamentali, e sono diventate un riferimento standard, pur dovendo essere adattate al contesto specifico di ciascuna disciplina. La \(d\) è adimensionale e permette di confrontare studi con scale diverse. L'opzione 2 riporta soglie troppo basse, vicine alle convenzioni usate per la correlazione \(r\) (\(0.1\), \(0.3\), \(0.5\)). L'opzione 3 riporta valori doppi rispetto agli standard di Cohen: \(d = 1.0\) corrisponderebbe già a una differenza di una deviazione standard, che per Cohen è classificata come grande. L'opzione 4 riporta valori nell'ordine di grandezza dei livelli di significatività \(\alpha\), senza alcun legame con le soglie della dimensione dell'effetto.

  • False
  • False
  • False
  • True

Come influisce la dimensione dell'effetto sulla potenza di un test, e quale ruolo ha nell'analisi della numerosità campionaria necessaria?

La potenza del test è \(1 - \beta = P(\text{rifiutare } H_0 \mid H_1 \text{ vera})\) e dipende da quattro quantità legate tra loro: il livello di significatività \(\alpha\), la numerosità campionaria \(n\), la variabilità del DGP \(\sigma\) e la distanza tra il valore vero e \(\mu_0\), riassunta dalla dimensione dell'effetto \(d\). A parità degli altri fattori, un effetto più grande produce un segnale più facile da rilevare: la potenza cresce. L'analisi della numerosità campionaria (power analysis) sfrutta proprio questa relazione: fissati \(\alpha\), la potenza desiderata (tipicamente \(0.80\) o \(0.90\)) e la dimensione dell'effetto minima considerata rilevante, si ricava il valore di \(n\) necessario. L'opzione 2 nega il ruolo della dimensione dell'effetto sulla potenza: contradice la formula della potenza, in cui la distanza \(|\mu_1-\mu_0|/\sigma\) compare esplicitamente. L'opzione 3 inverte la relazione: effetti più grandi sono più facili da rilevare e richiedono \(n\) più piccolo, non più grande. L'opzione 4 limita l'effetto ai test bilaterali: la dimensione dell'effetto influisce sulla potenza in entrambi i tipi di test.

  • False
  • False
  • False
  • True

Per un campione i.i.d. da \(\mathcal{N}(\mu, \sigma^2)\) con \(\mu\) incognita, si vuole testare \(H_0\colon \sigma^2 = \sigma^2_0\) contro \(H_1\colon \sigma^2 \neq \sigma^2_0\) al livello \(\alpha\). Qual è la statistica test, la sua distribuzione sotto \(H_0\) e la regola di decisione?

Con \(\mu\) incognita, la statistica pivot per \(\sigma^2\) è \((n-1)S_n^2/\sigma^2 \sim \chi^2(n-1)\). Sostituendo \(\sigma^2\) con \(\sigma^2_0\) sotto \(H_0\), la statistica test è \(Q_n = (n-1)S_n^2/\sigma^2_0 \sim \chi^2(n-1)\). Poiché la \(\chi^2\) è asimmetrica, la regione critica bilaterale non è simmetrica: si rifiuta \(H_0\) se \(Q_n\) è troppo piccolo (varianza campionaria molto minore di \(\sigma^2_0\)) oppure troppo grande, usando i quantili \(\chi^2_{n-1,\alpha/2}\) e \(\chi^2_{n-1,1-\alpha/2}\). L'opzione 2 usa il solo quantile superiore \(\chi^2_{n-1,1-\alpha}\): è la regola corretta per il test unilaterale \(H_1\colon \sigma^2 > \sigma^2_0\), non per quello bilaterale. L'opzione 3 usa \(n\) gradi di libertà e la varianza non corretta: sarebbero corretti se \(\mu\) fosse nota, nel qual caso si usa \(\sum(X_i-\mu)^2/\sigma^2_0 \sim \chi^2(n)\). L'opzione 4 attribuisce una distribuzione normale alla statistica test: la \(\chi^2\) è la distribuzione esatta, non un'approssimazione normale.

  • False
  • False
  • True
  • False

Per un campione i.i.d. da \(\text{Bernoulli}(\pi)\) con \(n\) grande, si vuole testare \(H_0\colon \pi = \pi_0\) contro \(H_1\colon \pi \neq \pi_0\) al livello \(\alpha\). Qual è la statistica test corretta e la sua distribuzione approssimata sotto \(H_0\)?

Sotto \(H_0\colon \pi = \pi_0\), il valore vero del parametro è noto: si usa \(\pi_0\) (non \(\hat{\pi}\)) per calcolare la varianza teorica della proporzione campionaria. La statistica test è: \[Z_n = \frac{\hat{\pi} - \pi_0}{\sqrt{\pi_0(1-\pi_0)/n}} \stackrel{a}{\sim} \mathcal{N}(0,1).\] Questa è la scelta corretta perché sfrutta l'informazione fornita da \(H_0\), producendo uno stimatore della varianza più accurato rispetto a \(\hat{\pi}(1-\hat{\pi})/n\) quando \(H_0\) è vera. L'opzione 2 usa \(\hat{\pi}\) invece di \(\pi_0\) nell'errore standard: è la formula usata per costruire l'IC (dove \(\pi_0\) non è noto), non per il test (dove si assume \(\pi_0\) noto sotto \(H_0\)). L'opzione 3 riporta la statistica corretta ma applica la regola di decisione del test unilaterale \(H_1\colon \pi > \pi_0\). L'opzione 4 usa \(\chi^2(2)\) invece di \(\chi^2(1)\): il quadrato di una \(\mathcal{N}(0,1)\) è \(\chi^2(1)\), non \(\chi^2(2)\).

  • False
  • True
  • False
  • False

Per testare \(H_0\colon \mu_1 = \mu_2\) con due campioni normali indipendenti, quando è preferibile usare il test di Welch rispetto al test sotto l'ipotesi di omoschedasticità, e in cosa differiscono?

Il test di Welch approssima i gradi di libertà effettivi con la formula di Welch-Satterthwaite: \[\nu \approx \frac{(S_1^2/n_1 + S_2^2/n_2)^2}{\dfrac{(S_1^2/n_1)^2}{n_1-1} + \dfrac{(S_2^2/n_2)^2}{n_2-1}},\] ottenendo una statistica \(t\) approssimata valida anche quando \(\sigma_1^2 \neq \sigma_2^2\). Il test omoscedatico (con varianza pooled \(S_p^2\)) è esatto sotto \(\mathcal{N}\) con \(\sigma_1^2 = \sigma_2^2\), ma può essere distorto se questa ipotesi non è soddisfatta. Nella pratica il test di Welch è spesso raccomandato come scelta di default, perché perde poco potenza quando le varianze sono uguali e rimane valido quando differiscono. L'opzione 2 afferma che la varianza pooled non è calcolabile per campioni sbilanciati: è errata, la pooled è definita per qualsiasi \(n_1, n_2\). L'opzione 3 afferma l'equivalenza per \(n\) grande: anche asintoticamente i due test differiscono quando \(\sigma_1^2 \neq \sigma_2^2\), perché la pooled stima la varianza sbagliata. L'opzione 4 afferma la superiorità incondizionata dell'omoscedatico: è valida solo se \(\sigma_1^2 = \sigma_2^2\) è verificata.

  • False
  • False
  • False
  • True

Per testare \(H_0\colon \sigma_1^2 = \sigma_2^2\) contro \(H_1\colon \sigma_1^2 \neq \sigma_2^2\) con due campioni indipendenti da \(\mathcal{N}(\mu_1,\sigma_1^2)\) e \(\mathcal{N}(\mu_2,\sigma_2^2)\) con medie incognite, qual è la statistica test e la sua distribuzione esatta sotto \(H_0\)?

Sotto \(H_0\colon \sigma_1^2 = \sigma_2^2 = \sigma^2\), le due statistiche \((n_i-1)S_i^2/\sigma^2 \sim \chi^2(n_i-1)\) sono indipendenti, quindi il loro rapporto diviso per i rispettivi gradi di libertà segue una distribuzione \(F\): \[F_n = \frac{S_1^2}{S_2^2} = \frac{(n_1-1)S_1^2/\sigma^2\;/\;(n_1-1)}{(n_2-1)S_2^2/\sigma^2\;/\;(n_2-1)} \sim F(n_1-1,\,n_2-1).\] Per il test bilaterale, la regione critica comprende entrambe le code della \(F\) (che è asimmetrica): si rifiuta \(H_0\) per valori di \(F_n\) molto piccoli o molto grandi. L'opzione 2 usa \(n_1, n_2\) gradi di libertà: sarebbero corretti se le medie fossero note. L'opzione 3 usa la regola di decisione del test unilaterale \(H_1\colon \sigma_1^2 > \sigma_2^2\): per il bilaterale occorre considerare entrambe le code. L'opzione 4 usa una funzione della differenza invece del rapporto: il rapporto è la quantità che, sotto \(H_0\), ha distribuzione \(F\) esatta.

  • False
  • True
  • False
  • False

Per testare \(H_0\colon \pi_1 = \pi_2\) con due campioni bernoulliani indipendenti, quali sono il test z e il test chi-quadrato e che relazione hanno tra loro?

Sotto \(H_0\colon \pi_1 = \pi_2\), la statistica z per il confronto tra proporzioni è: \[Z_n = \frac{\hat{\pi}_1 - \hat{\pi}_2}{\sqrt{\hat{\pi}(1-\hat{\pi})(1/n_1+1/n_2)}}, \quad \hat{\pi} = \frac{n_1\hat{\pi}_1 + n_2\hat{\pi}_2}{n_1+n_2}.\] Il test chi-quadrato per la stessa ipotesi usa la statistica \(X^2 = Z_n^2\), che sotto \(H_0\) è approssimativamente \(\chi^2(1)\) perché il quadrato di una \(\mathcal{N}(0,1)\) è \(\chi^2(1)\). I due test sono pertanto equivalenti per \(H_1\) bilaterale: producono lo stesso p-value. Il test z ha il vantaggio di essere applicabile anche a \(H_1\) unilaterale (il segno di \(Z_n\) indica la direzione), mentre la forma quadratica \(X^2\) perde l'informazione sul segno. L'opzione 2 afferma che i due test producono p-value diversi: per \(H_1\) bilaterale sono identici per costruzione (\(X^2 = Z_n^2\)). L'opzione 3 afferma che il \(\chi^2\) è più potente: i due test hanno la stessa potenza per \(H_1\) bilaterale, essendo formalmente equivalenti. L'opzione 4 limita rigidamente l'applicabilità: il test chi-quadrato può essere usato anche per \(H_1\) bilaterale, e il test z anche per \(H_1\) bilaterale tramite \(|Z_n|\).

  • False
  • False
  • True
  • False

In una tabella di contingenza \(r \times c\), il test di indipendenza del chi-quadrato verifica \(H_0\): le due variabili categoriali sono indipendenti. Qual è la statistica test, la sua distribuzione approssimata e come si calcolano le frequenze attese \(E_{ij}\)?

Sotto \(H_0\) di indipendenza, la frequenza attesa nella cella \((i,j)\) è il prodotto delle frequenze marginali di riga e colonna diviso per \(n\): \[E_{ij} = \frac{n_{i\cdot}\, n_{\cdot j}}{n},\] che stima la frequenza della cella se le due variabili fossero indipendenti. La statistica di Pearson \[X^2 = \sum_{i=1}^r\sum_{j=1}^c \frac{(O_{ij} - E_{ij})^2}{E_{ij}}\] misura lo scostamento complessivo tra frequenze osservate e attese, ed è approssimativamente \(\chi^2\) con \((r-1)(c-1)\) gradi di libertà: i gradi liberi si perdono per la stima degli \(r-1\) parametri di riga e \(c-1\) di colonna (con i vincoli sui totali marginali). L'opzione 2 usa \(rc-1\) gradi di libertà: è il numero di gradi di libertà di una distribuzione multinomiale su \(rc\) celle meno un vincolo, senza tener conto della struttura di indipendenza. L'opzione 3 divide per \(O_{ij}\) invece di \(E_{ij}\): è una forma alternativa (statistica di Freeman-Tukey) non standard. L'opzione 4 omette la divisione per \(E_{ij}\): senza standardizzazione, celle con frequenze assolute più alte contribuirebbero sproporzionatamente alla statistica.

  • True
  • False
  • False
  • False

L'ANOVA ad una via testa \(H_0\colon \mu_1 = \mu_2 = \cdots = \mu_k\) su \(k\) gruppi indipendenti con varianza comune \(\sigma^2\). Qual è la struttura della statistica test \(F\) e la sua distribuzione sotto \(H_0\)?

L'ANOVA scompone la variabilità totale in due componenti: \[SS_T = SS_B + SS_W,\] dove \(SS_B\) è la somma dei quadrati tra gruppi (deviazione delle medie di gruppo dalla media globale) e \(SS_W\) è la somma dei quadrati entro gruppi (deviazione delle osservazioni dalla propria media di gruppo). Dividendo per i rispettivi gradi di libertà si ottengono i quadrati medi \(MS_B = SS_B/(k-1)\) e \(MS_W = SS_W/(N-k)\). Sotto \(H_0\), entrambi stimano \(\sigma^2\) e il loro rapporto \(F = MS_B/MS_W \sim F(k-1, N-k)\). Poiché valori grandi di \(F\) indicano che la variabilità tra gruppi supera quella attesa per caso, il test è sempre unilaterale destro. L'opzione 2 inverte numeratore e denominatore: \(MS_W/MS_B\) sarebbe piccolo quando le medie differiscono, contrariamente alla logica del test. L'opzione 3 usa \(k\) invece di \(k-1\) al numeratore: i gradi di libertà tra gruppi sono \(k-1\) (un vincolo per la media globale stimata). L'opzione 4 attribuisce una distribuzione \(\chi^2\) alla statistica: il rapporto di due stime di varianza indipendenti segue una distribuzione \(F\), non \(\chi^2\).

  • False
  • True
  • False
  • False

Dopo un'ANOVA con \(k > 2\) gruppi che porta al rifiuto di \(H_0\), si vogliono identificare quali coppie di medie differiscono. Qual è la differenza tra confronti pianificati (a priori) e confronti post-hoc?

La distinzione è sostanziale e riguarda il controllo del tasso di errore. I confronti pianificati sono ipotizzati prima di raccogliere i dati sulla base di ragioni teoriche: il ricercatore specifica a priori un numero limitato di contrasti di interesse, e ciascuno può essere testato al livello \(\alpha\) senza necessità di correzione (o con correzioni minime). I confronti post-hoc esplorano tutte le \(\binom{k}{2}\) coppie di medie dopo aver osservato i dati: poiché si eseguono molti test simultanei, la probabilità di trovare almeno una differenza significativa per caso (errore di I tipo familiare) cresce, ed è necessario applicare correzioni (Bonferroni, Tukey HSD, Scheffé, ecc.) per controllare l'errore globale al livello \(\alpha\). L'opzione 2 afferma che i confronti pianificati richiedono l'ANOVA globale significativa: non è necessario, i contrasti a priori possono essere testati direttamente. L'opzione 3 inverte la relazione di potenza: i confronti post-hoc sono generalmente meno potenti perché richiedono correzioni conservative. L'opzione 4 afferma l'equivalenza se il numero di confronti è uguale: anche a parità di numero, la distinzione a priori/post-hoc ha conseguenze sul controllo dell'errore di tipo I.

  • False
  • False
  • True
  • False

Il test di accostamento (goodness-of-fit) del chi-quadrato verifica se i dati osservati sono compatibili con una distribuzione ipotizzata \(F_0\). Qual è la struttura della statistica test e quanti gradi di libertà ha, se si stimano \(p\) parametri dalla distribuzione ipotizzata?

La statistica di Pearson per il test di accostamento è: \[X^2 = \sum_{j=1}^k \frac{(O_j - E_j)^2}{E_j},\] dove \(k\) è il numero di classi, \(O_j\) le frequenze osservate e \(E_j = n\,p_j^{(0)}\) le frequenze attese sotto \(F_0\). I gradi di libertà sono \(k - 1 - p\): si perde un grado di libertà per il vincolo \(\sum O_j = n\) (che forza \(\sum E_j = n\)), e uno per ciascuno dei \(p\) parametri della distribuzione ipotizzata stimati dai dati. Se \(F_0\) è completamente specificata (\(p = 0\)), si hanno \(k-1\) gradi di libertà. L'opzione 2 usa sempre \(k-1\) gradi di libertà, ignorando la perdita dovuta ai parametri stimati: sovrastima i gradi di libertà e produce p-value sovrastimati quando \(p > 0\). L'opzione 3 usa \(k\) gradi di libertà senza il vincolo sui totali: è errata perché le \(k\) frequenze osservate soddisfano \(\sum O_j = n\), riducendo la libertà di una. L'opzione 4 divide per \(O_j\) invece di \(E_j\): è la statistica di Freeman-Tukey, non la forma standard del test di Pearson.

  • True
  • False
  • False
  • False

In cosa consiste un test Monte Carlo o un test bootstrap come alternativa ai test basati su distribuzioni asintotiche, e quando sono preferibili?

Nei test simulativi si approssima la distribuzione della statistica test \(T_n\) sotto \(H_0\) generando \(B\) campioni (dal DGP ipotizzato in Monte Carlo, dal campione osservato in bootstrap) e calcolando \(T_n\) su ciascuno. Il p-value empirico è la proporzione di valori simulati \(t_n^{*(b)}\) che superano il valore osservato \(t_n^{\text{obs}}\). Questi test sono particolarmente utili quando: (i) la statistica test non ha distribuzione asintotica semplice; (ii) la dimensione campionaria è troppo piccola per l'approssimazione asintotica; (iii) il DGP non è facilmente modellabile analiticamente. L'opzione 2 afferma che i test simulativi sono sempre meno potenti degli asintotici: non è vero in generale; per statistiche non standard o campioni piccoli possono avere potenza paragonabile o superiore. L'opzione 3 afferma che i test simulativi producono p-value esatti: il p-value simulativo è esso stesso una stima (con variabilità crescente al diminuire di \(B\)), non un valore esatto. L'opzione 4 afferma la coincidenza con l'asintotico per \(n\) grande: è approssimativamente vera ma non è il motivo per preferire i test simulativi, che al contrario sono più utili per \(n\) piccolo.

  • True
  • False
  • False
  • False

Quali sono i quattro principali metodi di costruzione degli stimatori e qual è il principio che guida ciascuno?

I quattro metodi si distinguono per il principio ottimizzante:

  • Massima verosimiglianza (MV): cerca il valore di \(\theta\) che massimizza \(L(\theta;\mathbf{x})\), ovvero rende i dati osservati il più plausibili possibile. Produce stimatori con ottime proprietà asintotiche (consistenza, efficienza asintotica).
  • Minimi quadrati (MQ): minimizza la somma dei quadrati degli scarti tra valori osservati e valori attesi dal modello. Coincide con MV quando gli errori sono normali e omoschedastici.
  • Momenti: uguaglia i momenti teorici della distribuzione (funzioni di \(\theta\)) ai corrispondenti momenti campionari; si ricava \(\theta\) risolvendo il sistema di equazioni risultante. Più semplice da calcolare, ma in generale meno efficiente di MV.
  • Bayesiano: incorpora una distribuzione a priori \(p(\theta)\) sulla conoscenza pre-dati e la aggiorna con i dati tramite il teorema di Bayes, ottenendo la distribuzione a posteriori \(p(\theta \mid \mathbf{x}) \propto L(\theta;\mathbf{x})\,p(\theta)\); la stima è tipicamente la moda o la media a posteriori.

L'opzione 2 confonde MQ con MV e descrive erroneamente il metodo dei momenti e quello bayesiano. L'opzione 3 afferma che i quattro metodi producono sempre lo stesso stimatore: coincidono solo in casi speciali (es. MV e MQ per il modello normale lineare). L'opzione 4 limita artificialmente il campo di applicazione di ciascun metodo: tutti e quattro sono applicabili a una grande varietà di modelli.

  • False
  • True
  • False
  • False

La funzione potenza \(\beta(\theta)\) di un test è definita come la probabilità di rifiutare \(H_0\) al variare del vero valore del parametro \(\theta\). Quale delle seguenti affermazioni ne descrive correttamente l'andamento per un test unidirezionale e per un test bidirezionale sulla media \(\mu\) di un DGP normale con \(\sigma\) nota?

La funzione potenza \(\beta(\mu) = P(\text{rifiutare } H_0 \mid \mu)\) descrive le proprietà operative del test per ogni possibile valore vero del parametro. I due andamenti sono:

  • Test unidirezionale (\(H_1\colon \mu > \mu_0\)): \(\beta(\mu)\) è monotona crescente in \(\mu\). In \(\mu = \mu_0\) vale esattamente \(\alpha\) (livello del test); per \(\mu < \mu_0\) scende sotto \(\alpha\) (regione in cui il test è conservativo); per \(\mu > \mu_0\) cresce verso 1 all'aumentare dello scostamento.
  • Test bidirezionale (\(H_1\colon \mu \neq \mu_0\)): \(\beta(\mu)\) ha forma a U, simmetrica attorno a \(\mu_0\), con minimo pari ad \(\alpha\) in \(\mu_0\) e \(\beta(\mu) \to 1\) per \(|\mu - \mu_0| \to +\infty\) in entrambe le direzioni.

In entrambi i casi la funzione potenza coincide con il livello \(\alpha\) sotto \(H_0\): è questa la definizione stessa di livello del test. L'opzione 2 afferma che \(\beta(\mu) = \alpha\) per ogni \(\mu\): è vero solo in \(\mu_0\), non per \(\mu \neq \mu_0\). L'opzione 3 inverte le forme dei due andamenti: è il test bidirezionale ad avere la forma a U, non quello unidirezionale. L'opzione 4 afferma la superiorità globale del test bidirezionale: per \(\mu > \mu_0\), il test unidirezionale destro è più potente del bidirezionale perché concentra tutta la probabilità \(\alpha\) sulla coda destra; il bidirezionale è più potente del corrispondente unidirezionale solo dalla parte opposta a quella specificata.

  • False
  • False
  • False
  • True