# PUNTO 5 ------------------------------------------------
HW 08 - Numerosità campionaria, IC per la proporzione e introduzione al test di ipotesi
Data di consegna: venerdì 12 giugno 2026
Introduzione
In questo compito affronterai tre temi distinti ma collegati: la determinazione della numerosità campionaria ottimale, il confronto tra diversi metodi per costruire un intervallo di confidenza per la proporzione, e l’introduzione alla logica del test di ipotesi con particolare attenzione alla struttura degli errori del I e II tipo e alla potenza del test.
Obiettivi di apprendimento
Lo svolgimento di questo compito ti permetterà di:
- calcolare la numerosità campionaria minima che garantisce un dato margine di errore per la stima della media e della proporzione
- costruire IC unilaterali e interpretarli correttamente
- confrontare l’IC di Wald, l’IC di Wilson e l’IC esatto per la proporzione, evidenziando differenze e contesti d’uso
- descrivere la struttura di un test di ipotesi, identificare gli errori del I e II tipo e calcolare la potenza
- condurre in R un test sulla media con varianza nota e incognita e interpretare il p-value restituito dalle funzioni
z.testet.test
Istruzioni per l’uso
Esercizi carta e penna
Rispondi ai vari punti su un foglio in cui scrivi chiaramente cognome, nome e matricola e numero del compito: ad esempio nel mio caso sarebbe Vistocco Domenico, matricola 123456, soluzione compito
#08Per rispondere ad ogni punto scrivi chiaramente il punto cui stai rispondendo. Ad esempio, per rispondere al punto 1 del compito, scrivi
RISPOSTA PUNTO 1
Esercizi in R
Rispondi ai vari punti salvando le risposte in un file R con il nome “hw08_cognome_nome.R”: ad esempio nel mio caso il nome del file sarebbe “hw08_vistocco_domenico.R”.
Per rispondere ad ogni punto inserisci un’etichetta di sezione (che puoi inserire nello script usando la combinazione di tasti CTRL/CMD + SHIFT + R) utilizzando il punto cui stai rispondendo. Ad esempio, per rispondere al punto 5 del compito, usa un’etichetta di sezione:
Utilizza i commenti per rispondere alle domande in cui viene chiesta un’interpretazione da parte tua: lo script deve cioè essere funzionante quando si eseguono tutti i comandi con il pulsante Source.
Lo script viene valutato sia in base alla correttezza del codice che in base alla qualità (stile utilizzato per rendere lo script leggibile ed ordinato).
Esercizi
Parte 1: esercizi carta e penna
Un istituto di ricerca vuole stimare il reddito medio mensile (in euro) di una categoria di lavoratori autonomi. Da studi precedenti si sa che la deviazione standard della distribuzione dei redditi è \(\sigma = 800\) euro. Si assume un DGP normale.
Quante osservazioni sono necessarie per ottenere un IC al 95% con margine di errore \(E \leq 100\) euro? E per ottenere \(E \leq 50\) euro? Commenta come cambia \(n\) al dimezzarsi del margine di errore.
Con \(n = 200\) intervistati si osserva \(\bar{x} = 2\,340\) euro. Costruisci un IC unilaterale sinistro al 95% per \(\mu\), cioè del tipo \((-\infty,\; U)\), e un IC unilaterale destro al 95% del tipo \((L,\; +\infty)\). In quale situazione pratica preferiresti l’uno o l’altro?
Un IC unilaterale si ottiene invertendo la statistica pivotale imponendo il vincolo su un solo lato. Per una media con varianza nota al livello \(1 - \alpha\):
- IC sinistro \(\left(-\infty,\; \bar{X} + z_\alpha \frac{\sigma}{\sqrt{n}}\right)\): utile quando si vuole porre un limite superiore al parametro
- IC destro \(\left(\bar{X} - z_\alpha \frac{\sigma}{\sqrt{n}},\; +\infty\right)\): utile quando si vuole garantire un valore minimo
Nota che si usa \(z_\alpha\) (non \(z_{\alpha/2}\)) perché tutta l’area di non copertura è concentrata su un lato solo.
- Per la stima di una proporzione, quante interviste sono necessarie per ottenere un IC al 95% con margine di errore \(E \leq 0{,}04\), nella situazione più sfavorevole (\(\hat{\pi} = 0{,}5\))? E se da un’indagine pilota si sa che \(\pi \approx 0{,}20\)?
In uno studio clinico si vuole confrontare l’efficacia di due trattamenti per una certa patologia. Su \(n_1 = 180\) pazienti trattati con il farmaco A, \(x_1 = 126\) mostrano miglioramento. Su \(n_2 = 200\) pazienti trattati con il farmaco B, \(x_2 = 130\) mostrano miglioramento.
Calcola le proporzioni campionarie \(\hat{\pi}_1\) e \(\hat{\pi}_2\) e la proporzione pooled \(\hat{\pi}_p = (x_1 + x_2)/(n_1 + n_2)\).
Costruisci un IC al 95% per \(\pi_1 - \pi_2\) usando lo stimatore pooled per lo standard error: \[\text{SE}_{\text{pool}} = \sqrt{\hat{\pi}_p(1-\hat{\pi}_p)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}\]
Costruisci lo stesso IC usando le stime campionarie separate per lo standard error: \[\text{SE}_{\text{sep}} = \sqrt{\frac{\hat{\pi}_1(1-\hat{\pi}_1)}{n_1}+\frac{\hat{\pi}_2(1-\hat{\pi}_2)}{n_2}}\]
Confronta i due intervalli: qual è più ampio? In quale situazione è preferibile usare lo stimatore pooled e in quale quello separato?
Considera ora separatamente la proporzione \(\hat{\pi}_1 = x_1/n_1\) del farmaco A. Calcola l’IC al 95% con il metodo di Wald e con il metodo di Wilson (equazione quadratica). Riporta i due intervalli e commenta: sono molto diversi in questo caso? Quando ti aspetteresti differenze più marcate tra i due metodi?
L’IC di Wilson si ottiene invertendo il test dello score: invece di stimare la varianza con \(\hat{\pi}\), si usa il valore ipotetico \(\pi_0\) e si risolve l’equazione quadratica \[\left(\hat{\pi} - \pi\right)^2 = z_{\alpha/2}^2 \frac{\pi(1-\pi)}{n}\] La soluzione fornisce gli estremi: \[\frac{\hat{\pi} + \frac{z^2}{2n} \pm z\sqrt{\frac{\hat{\pi}(1-\hat{\pi})}{n}+\frac{z^2}{4n^2}}}{1+\frac{z^2}{n}}\] dove \(z = z_{\alpha/2}\).
Il contenuto medio dichiarato di un flacone di sciroppo è \(\mu_0 = 250\) ml. Un consumatore sospetta che il riempimento sia sistematicamente inferiore al dichiarato. Misura il contenuto di \(n = 36\) flaconi scelti casualmente, ottenendo \(\bar{x} = 247{,}4\) ml. Da controlli di processo è noto che \(\sigma = 8\) ml.
Formula l’ipotesi nulla \(H_0\) e l’ipotesi alternativa \(H_1\) appropriate al problema. Giustifica la scelta di un test unilaterale sinistro.
Scrivi la statistica test \(Z\) per questo problema, indicane la distribuzione sotto \(H_0\) e calcola il valore osservato \(z_{\text{obs}}\).
Calcola il p-value del test e interpretalo. Usando il p-value, prendi una decisione con \(\alpha = 0{,}05\) e con \(\alpha = 0{,}01\). Il criterio del p-value porta alla stessa conclusione del criterio della regione di rifiuto?
Il p-value è la probabilità, calcolata sotto \(H_0\), di osservare un valore della statistica test almeno altrettanto estremo di quello effettivamente osservato nella direzione indicata da \(H_1\). Per un test unilaterale sinistro: \(\text{p-value} = P(Z \leq z_{\text{obs}} \mid H_0)\). La regola di decisione è: si rifiuta \(H_0\) se \(\text{p-value} \leq \alpha\). Più il p-value è piccolo, maggiore è l’evidenza campionaria contro \(H_0\).
Fissato \(\alpha = 0{,}05\), determina la regione di rifiuto del test e verifica che la decisione coincida con quella basata sul p-value del punto (c).
Descrivi con parole tue cosa significa commettere un errore del I tipo e un errore del II tipo in questo specifico contesto. Quali sarebbero le conseguenze pratiche di ciascuno dei due errori?
Descrivi brevemente cosa si intende per potenza del test \(1 - \beta\): da quali fattori dipende e in quale direzione? (Non è richiesto alcun calcolo numerico.)
Parte 2: esercizi in R
I dati per gli esercizi in R sono forniti direttamente nel testo. Copia i vettori nel tuo script prima di iniziare.
# Flaconi di sciroppo (ml) — n = 36, sigma = 8 nota
flaconi <- c(245.2, 251.3, 243.8, 248.6, 246.1, 244.7, 252.0, 247.3, 241.9,
249.5, 246.8, 243.2, 250.1, 247.6, 244.3, 248.9, 245.7, 242.4,
251.6, 246.5, 244.0, 249.2, 247.0, 243.5, 250.8, 246.3, 244.8,
248.1, 245.9, 242.7, 251.4, 247.8, 244.5, 249.7, 246.2, 243.1)
# Farmaco A — proporzione di miglioramento (dati binari: 1 = miglioramento)
set.seed(5)
farmaco_A <- sample(c(rep(1, 126), rep(0, 54)))
# Farmaco B — proporzione di miglioramento
set.seed(9)
farmaco_B <- sample(c(rep(1, 130), rep(0, 70)))Per i dati
farmaco_A, calcola e confronta i tre IC al 95% per \(\pi_1\):- Wald (approssimazione normale): usa la funzione
ic_propscritta nell’HW 07 - Wilson (score): usa
prop.test(sum(farmaco_A), length(farmaco_A), correct = FALSE)$conf.int - Esatto (Clopper-Pearson): usa
binom.test(sum(farmaco_A), length(farmaco_A))$conf.int
Riporta i tre intervalli affiancati e commenta le differenze.
- Wald (approssimazione normale): usa la funzione
Il metodo esatto di Clopper-Pearson costruisce l’IC invertendo il test binomiale esatto. Gli estremi dell’intervallo corrispondono ai quantili di distribuzioni Beta: l’estremo inferiore è il quantile \(\alpha/2\) di una \(\text{Beta}(x, n-x+1)\) e l’estremo superiore è il quantile \(1-\alpha/2\) di una \(\text{Beta}(x+1, n-x)\), dove \(x\) è il numero di successi osservati. In R puoi verificarlo con qbeta(0.025, x, n-x+1) e qbeta(0.975, x+1, n-x).
Ripeti il confronto dei tre metodi per proporzioni osservate molto basse e molto alte: calcola i tre IC al 95% per \(\hat{\pi} = 3/50\) e per \(\hat{\pi} = 47/50\). In questi casi estremi le differenze tra i metodi sono più marcate? Quale metodo ha un comportamento più regolare?
Costruisci l’IC al 95% bootstrap per \(\pi_1\) usando \(B = 5\,000\) ricampionamenti da
farmaco_A. Confrontalo con i tre IC del punto (a): è coerente con i metodi analitici?Costruisci l’IC al 95% per la differenza \(\pi_1 - \pi_2\) in due modi:
- usando la funzione
ic_diff_propdell’HW 07 (metodo con SE separate) - con un IC bootstrap sulla differenza: per ogni ricampionamento estrai un campione da
farmaco_Ae uno dafarmaco_Be calcola la differenza tra le proporzioni campionarie
Confronta i due intervalli e commenta.
- usando la funzione
Usando il vettore
flaconi, esegui il test dell’Esercizio 3 con varianza nota (\(\sigma = 8\)) in due modi e verifica che i risultati coincidano:- manualmente: calcola \(z_{\text{obs}}\) e il p-value con
pnorm, poi confronta il p-value con \(\alpha = 0{,}05\) per prendere la decisione - con la funzione
z.testdel pacchettoTeachingDemos:
library(TeachingDemos) z.test(flaconi, mu = 250, sigma.x = 8, alternative = "less")Dall’output di
z.testleggi e commenta: il valore di \(z_{\text{obs}}\), il p-value e l’IC unilaterale restituito. La decisione basata sul p-value è coerente con quella ottenuta a mano nell’Esercizio 3?- manualmente: calcola \(z_{\text{obs}}\) e il p-value con
Esegui lo stesso test assumendo ora che \(\sigma\) sia incognita con
t.test(flaconi, mu = 250, alternative = "less"). Leggi dall’output il valore della statistica test, i gradi di libertà, il p-value e l’IC unilaterale. Confronta il p-value con quello del punto (a): la conclusione cambia?
Consegna
Puoi inviare la tua soluzione scannerizzando i fogli relativi agli esercizi carta e penna, comprimendo il file ottenuto insieme al file
.Rin un file.zipe caricando il file in risposta al compito assegnato su Teams.Puoi consegnare al docente il compito svolto in aula durante la lezione del martedì, stampando il file
.Re consegnandolo insieme alle soluzioni agli esercizi numerici. In questo caso, in risposta al compito assegnato su Teams carica un file di testo o MS-Word scrivendo semplicementeconsegnato in aula.
Valutazione
Totale punti disponibili: 110 punti
| Componente | Punti |
|---|---|
| Es 1 - 5 | 100 |
| Workflow & formattazione | 101 |
Footnotes
La valutazione al “Workflow & formattazione” tiene conto:
- per gli esercizicarta e penna, dell’ordine con cui svolgi gli esercizi e delle argomentazioni date alle risposte aperte
- per gli esercizi suR, del principio di riproducibilità del codice: lo script caricato deve funzionare senza errori su qualunque PC dando gli stessi risultati↩︎