# PUNTO 5 ------------------------------------------------
HW 06 - Problemi a due popolazioni e metodi di simulazione
Data di consegna: venerdì 22 maggio 2026
Introduzione
In questo compito utilizzerai le regole e i comandi utili per:
- identificare la statistica campionaria corretta per confrontare medie, varianze e proporzioni di due popolazioni indipendenti
- lavorare con la distribuzione \(F\) di Fisher per il confronto tra varianze
- stimare la distribuzione campionaria di una statistica tramite il metodo Monte Carlo e il metodo bootstrap
- confrontare la distribuzione campionaria della media e della mediana, evidenziando il ruolo della simulazione quando non esiste una formula analitica
Obiettivi di apprendimento
Lo svolgimento di questo compito ti permetterà di:
- scrivere le statistiche pivotali per i problemi a due popolazioni (medie, varianze, proporzioni) e associare a ciascuna la distribuzione campionaria corretta
- usare
pfeqfper calcolare probabilità e quantili della distribuzione \(F\) in R - implementare una simulazione Monte Carlo per ottenere la distribuzione campionaria empirica di qualsiasi statistica
- costruire la distribuzione bootstrap di una statistica e usarla per stimare il suo errore standard
Istruzioni per l’uso
Esercizi carta e penna
Rispondi ai vari punti su un foglio in cui scrivi chiaramente cognome, nome e matricola e numero del compito: ad esempio nel mio caso sarebbe Vistocco Domenico, matricola 123456, soluzione compito
#06Per rispondere ad ogni punto scrivi chiaramente il punto cui stai rispondendo. Ad esempio, per rispondere al punto 1 del compito, scrivi
RISPOSTA PUNTO 1
Esercizi in R
Rispondi ai vari punti salvando le risposte in un file R con il nome “hw06_cognome_nome.R”: ad esempio nel mio caso il nome del file sarebbe “hw06_vistocco_domenico.R”.
Per rispondere ad ogni punto inserisci un’etichetta di sezione (che puoi inserire nello script usando la combinazione di tasti CTRL/CMD + SHIFT + R) utilizzando il punto cui stai rispondendo. Ad esempio, per rispondere al punto 5 del compito, usa un’etichetta di sezione:
Utilizza i commenti per rispondere alle domande in cui viene chiesta un’interpretazione da parte tua: lo script deve cioè essere funzionante quando si eseguono tutti i comandi con il pulsante Source.
Lo script viene valutato sia in base alla correttezza del codice che in base alla qualità (stile utilizzato per rendere lo script leggibile ed ordinato).
Esercizi
Parte 1: esercizi carta e penna
Un’azienda agricola vuole confrontare la resa (in quintali per ettaro) di due varietà di grano, A e B, coltivate su appezzamenti scelti casualmente. Si assume che le rese seguano una distribuzione normale in entrambe le popolazioni.
I dati osservati su due campioni indipendenti sono:
- Varietà A: \(n_A = 12\), \(\bar{x}_A = 48{,}3\), \(s_A = 5{,}2\)
- Varietà B: \(n_B = 15\), \(\bar{x}_B = 44{,}7\), \(s_B = 4{,}8\)
- Si vuole innanzitutto confrontare la variabilità delle due varietà. Scrivi la statistica pivotale per il confronto tra \(\sigma^2_A\) e \(\sigma^2_B\) (con medie incognite) e indicane la distribuzione campionaria esatta specificando i gradi di libertà.
La distribuzione \(F\) di Fisher con \(\nu_1\) e \(\nu_2\) gradi di libertà è definita come il rapporto tra due variabili \(\chi^2\) indipendenti, ciascuna divisa per i propri gradi di libertà: \[F = \frac{\chi^2_{\nu_1}/\nu_1}{\chi^2_{\nu_2}/\nu_2} \sim F(\nu_1,\, \nu_2)\] La distribuzione \(F\) è definita su \((0, +\infty)\), ha forma asimmetrica a destra e dipende da due parametri (i gradi di libertà al numeratore \(\nu_1\) e al denominatore \(\nu_2\)). È la distribuzione campionaria naturale del rapporto tra due varianze campionarie: se \(S^2_1\) e \(S^2_2\) sono le varianze campionarie corrette di due campioni indipendenti da popolazioni normali con \(\sigma^2_1 = \sigma^2_2\), allora \(S^2_1/S^2_2 \sim F(n_1-1,\, n_2-1)\).
Calcola il valore osservato della statistica e commentalo: i dati sono compatibili con l’ipotesi \(\sigma^2_A = \sigma^2_B\)?
Sulla base del confronto tra varianze del punto (b), scegli la statistica pivotale appropriata per confrontare le due medie \(\mu_A\) e \(\mu_B\) (varianze incognite e uguali oppure varianze incognite e diverse) e indicane la distribuzione campionaria.
Calcola il valore osservato della statistica per il confronto tra le medie e commenta: i dati suggeriscono una differenza tra le rese medie delle due varietà?
Compila la seguente tabella riepilogativa per i problemi a due popolazioni indipendenti:
| Parametro | Informazione disponibile | Statistica campionaria | Distribuzione campionaria |
|---|---|---|---|
| \(\mu_1 - \mu_2\) | \(\sigma^2_1, \sigma^2_2\) note | ||
| \(\mu_1 - \mu_2\) | \(\sigma^2_1 = \sigma^2_2\) incognite | ||
| \(\mu_1 - \mu_2\) | \(\sigma^2_1 \neq \sigma^2_2\) incognite | ||
| \(\sigma^2_1/\sigma^2_2\) | \(\mu_1, \mu_2\) note | ||
| \(\sigma^2_1/\sigma^2_2\) | \(\mu_1, \mu_2\) incognite | ||
| \(\pi_1 - \pi_2\) | — |
In un sondaggio su due città, si vuole confrontare la proporzione di residenti favorevoli a una nuova politica ambientale.
- Città 1: \(n_1 = 200\) intervistati, \(x_1 = 94\) favorevoli
- Città 2: \(n_2 = 180\) intervistati, \(x_2 = 72\) favorevoli
Calcola le proporzioni campionarie \(\hat{\pi}_1\) e \(\hat{\pi}_2\) e la proporzione pooled \(\hat{\pi}_p = (x_1 + x_2)/(n_1 + n_2)\).
Scrivi la statistica per il confronto tra \(\pi_1\) e \(\pi_2\), indicandone la distribuzione campionaria asintotica. Specifica sotto quali condizioni l’approssimazione normale è valida e verifica che siano soddisfatte in questo caso.
Calcola il valore osservato della statistica e commenta: i dati forniscono evidenza di una differenza tra le proporzioni nelle due città?
Parte 2: esercizi in R
Esplora in R la distribuzione \(F\) di Fisher e usala per completare l’analisi dell’Esercizio 1.
Traccia in un grafico diviso in sei pannelli (\(2 \times 3\)) la densità della distribuzione \(F\) per le seguenti coppie di gradi di libertà: \((3, 3)\), \((5, 10)\), \((10, 10)\), \((10, 30)\), \((30, 30)\), \((50, 100)\). Usa la funzione
dfe adatta l’asse \(x\) a ciascun pannello. Aggiungi a ogni pannello il titolo con i gradi di libertà.Commenta la forma della distribuzione: come cambia al crescere dei gradi di libertà? Verso quale distribuzione sembra convergere per gradi di libertà molto grandi?
Usando
pfeqf, calcola per la distribuzione \(F(11, 14)\) dell’Esercizio 1:- il quantile al 97.5%
- il quantile al 2.5% (ricorda la relazione \(F_{1-\alpha/2}(\nu_1, \nu_2) = 1/F_{\alpha/2}(\nu_2, \nu_1)\))
- la probabilità \(P(F \leq f_{\text{obs}})\), dove \(f_{\text{obs}}\) è il valore calcolato al punto (b) dell’Esercizio 1
Usa il metodo Monte Carlo per confrontare la distribuzione campionaria della media e della mediana in due scenari con DGP diversi.
Fissa \(B = 10\,000\) simulazioni e considera due DGP:
- DGP normale: \(X \sim N(\mu = 5,\; \sigma^2 = 4)\)
- DGP esponenziale: \(X \sim \text{Exp}(\text{rate} = 1/5)\) (media = 5, ma distribuzione asimmetrica)
Per ciascun DGP e per ciascuna delle dimensioni campionarie \(n \in \{10, 50\}\), genera \(B\) campioni e calcola, per ognuno, sia la media che la mediana campionaria. Usa
map_dbldipurrrper l’iterazione.Costruisci un grafico diviso in quattro pannelli (\(2 \times 2\): DGP sulle righe, \(n\) sulle colonne). In ogni pannello sovrapponi i due istogrammi (media in blu trasparente, mediana in rosso trasparente) usando lo stesso asse \(x\) per i due pannelli della stessa riga.
Per ciascuno degli otto casi (2 DGP × 2 valori di \(n\) × 2 statistiche), riporta in una tabella: media delle \(B\) stime (prossima al vero \(\mu = 5\)?), deviazione standard delle \(B\) stime (errore standard empirico). Commenta:
- Per il DGP normale, quale statistica ha errore standard minore? Il risultato è coerente con quanto ci aspettiamo dalla teoria?
- Per il DGP esponenziale il risultato cambia? Perché?
Per sovrapporre due istogrammi con trasparenza:
hist(medie, col = rgb(0, 0, 1, 0.4), freq = FALSE, main = "", xlab = "")
hist(mediane, col = rgb(1, 0, 0, 0.4), freq = FALSE, add = TRUE)
legend("topright", legend = c("Media", "Mediana"),
fill = c(rgb(0,0,1,0.4), rgb(1,0,0,0.4)))Usa il metodo bootstrap per stimare l’errore standard della mediana e confrontarlo con quello della media su un campione osservato.
Genera un campione osservato di \(n = 30\) osservazioni da una distribuzione \(\text{Exp}(\text{rate} = 0{,}2)\) usando
set.seed(42). Calcola la media e la mediana campionaria.Implementa il bootstrap con \(B = 5\,000\) ricampionamenti: per ogni ricampionamento (con reinserimento, stesso \(n\)) calcola media e mediana. Usa
map_dblper l’iterazione.Rappresenta le due distribuzioni bootstrap in un grafico a due pannelli affiancati. Aggiungi in ciascun pannello una linea verticale in corrispondenza della stima sul campione originale.
Stima l’errore standard bootstrap di media e mediana e confrontali. Il risultato è coerente con quanto osservato nella simulazione Monte Carlo dell’Esercizio 4?
Ripeti l’analisi dei punti (b)–(d) su un secondo campione di \(n = 30\) generato da una \(N(\mu = 5,\; \sigma^2 = 4)\) con
set.seed(42). Come cambiano gli errori standard bootstrap rispetto al caso esponenziale? La differenza relativa tra i due (media vs mediana) va nella direzione attesa?
Uno schema possibile per il bootstrap:
B <- 5000
n <- length(campione)
boot_med <- map_dbl(1:B, \(i) median(sample(campione, size = n, replace = TRUE)))Consegna
Puoi inviare la tua soluzione scannerizzando i fogli relativi agli esercizi carta e penna, comprimendo il file ottenuto insieme al file
.Rin un file.zipe caricando il file in risposta al compito assegnato su Teams.Puoi consegnare al docente il compito svolto in aula durante la lezione del martedì, stampando il file
.Re consegnandolo insieme alle soluzioni agli esercizi numerici. In questo caso, in risposta al compito assegnato su Teams carica un file di testo o MS-Word scrivendo semplicementeconsegnato in aula.
Valutazione
Totale punti disponibili: 110 punti
| Componente | Punti |
|---|---|
| Es 1 - 5 | 100 |
| Workflow & formattazione | 101 |
Footnotes
La valutazione al “Workflow & formattazione” tiene conto:
- per gli esercizicarta e penna, dell’ordine con cui svolgi gli esercizi e delle argomentazioni date alle risposte aperte
- per gli esercizi suR, del principio di riproducibilità del codice: lo script caricato deve funzionare senza errori su qualunque PC dando gli stessi risultati↩︎