HW 06 - Problemi a due popolazioni e metodi di simulazione

Data di consegna: venerdì 22 maggio 2026

Introduzione

In questo compito utilizzerai le regole e i comandi utili per:

  • identificare la statistica campionaria corretta per confrontare medie, varianze e proporzioni di due popolazioni indipendenti
  • lavorare con la distribuzione \(F\) di Fisher per il confronto tra varianze
  • stimare la distribuzione campionaria di una statistica tramite il metodo Monte Carlo e il metodo bootstrap
  • confrontare la distribuzione campionaria della media e della mediana, evidenziando il ruolo della simulazione quando non esiste una formula analitica

Obiettivi di apprendimento

Lo svolgimento di questo compito ti permetterà di:

  • scrivere le statistiche pivotali per i problemi a due popolazioni (medie, varianze, proporzioni) e associare a ciascuna la distribuzione campionaria corretta
  • usare pf e qf per calcolare probabilità e quantili della distribuzione \(F\) in R
  • implementare una simulazione Monte Carlo per ottenere la distribuzione campionaria empirica di qualsiasi statistica
  • costruire la distribuzione bootstrap di una statistica e usarla per stimare il suo errore standard

Istruzioni per l’uso

Esercizi carta e penna

  • Rispondi ai vari punti su un foglio in cui scrivi chiaramente cognome, nome e matricola e numero del compito: ad esempio nel mio caso sarebbe Vistocco Domenico, matricola 123456, soluzione compito #06

  • Per rispondere ad ogni punto scrivi chiaramente il punto cui stai rispondendo. Ad esempio, per rispondere al punto 1 del compito, scrivi RISPOSTA PUNTO 1

Esercizi in R

  • Rispondi ai vari punti salvando le risposte in un file R con il nome “hw06_cognome_nome.R”: ad esempio nel mio caso il nome del file sarebbe “hw06_vistocco_domenico.R”.

  • Per rispondere ad ogni punto inserisci un’etichetta di sezione (che puoi inserire nello script usando la combinazione di tasti CTRL/CMD + SHIFT + R) utilizzando il punto cui stai rispondendo. Ad esempio, per rispondere al punto 5 del compito, usa un’etichetta di sezione:

    # PUNTO 5 ------------------------------------------------
  • Utilizza i commenti per rispondere alle domande in cui viene chiesta un’interpretazione da parte tua: lo script deve cioè essere funzionante quando si eseguono tutti i comandi con il pulsante Source.

  • Lo script viene valutato sia in base alla correttezza del codice che in base alla qualità (stile utilizzato per rendere lo script leggibile ed ordinato).

Esercizi

Parte 1: esercizi carta e penna

NoteEsercizio 1

Un’azienda agricola vuole confrontare la resa (in quintali per ettaro) di due varietà di grano, A e B, coltivate su appezzamenti scelti casualmente. Si assume che le rese seguano una distribuzione normale in entrambe le popolazioni.

I dati osservati su due campioni indipendenti sono:

  • Varietà A: \(n_A = 12\), \(\bar{x}_A = 48{,}3\), \(s_A = 5{,}2\)
  • Varietà B: \(n_B = 15\), \(\bar{x}_B = 44{,}7\), \(s_B = 4{,}8\)
  1. Si vuole innanzitutto confrontare la variabilità delle due varietà. Scrivi la statistica pivotale per il confronto tra \(\sigma^2_A\) e \(\sigma^2_B\) (con medie incognite) e indicane la distribuzione campionaria esatta specificando i gradi di libertà.
TipDistribuzione F di Fisher

La distribuzione \(F\) di Fisher con \(\nu_1\) e \(\nu_2\) gradi di libertà è definita come il rapporto tra due variabili \(\chi^2\) indipendenti, ciascuna divisa per i propri gradi di libertà: \[F = \frac{\chi^2_{\nu_1}/\nu_1}{\chi^2_{\nu_2}/\nu_2} \sim F(\nu_1,\, \nu_2)\] La distribuzione \(F\) è definita su \((0, +\infty)\), ha forma asimmetrica a destra e dipende da due parametri (i gradi di libertà al numeratore \(\nu_1\) e al denominatore \(\nu_2\)). È la distribuzione campionaria naturale del rapporto tra due varianze campionarie: se \(S^2_1\) e \(S^2_2\) sono le varianze campionarie corrette di due campioni indipendenti da popolazioni normali con \(\sigma^2_1 = \sigma^2_2\), allora \(S^2_1/S^2_2 \sim F(n_1-1,\, n_2-1)\).

  1. Calcola il valore osservato della statistica e commentalo: i dati sono compatibili con l’ipotesi \(\sigma^2_A = \sigma^2_B\)?

  2. Sulla base del confronto tra varianze del punto (b), scegli la statistica pivotale appropriata per confrontare le due medie \(\mu_A\) e \(\mu_B\) (varianze incognite e uguali oppure varianze incognite e diverse) e indicane la distribuzione campionaria.

  3. Calcola il valore osservato della statistica per il confronto tra le medie e commenta: i dati suggeriscono una differenza tra le rese medie delle due varietà?

  4. Compila la seguente tabella riepilogativa per i problemi a due popolazioni indipendenti:

Parametro Informazione disponibile Statistica campionaria Distribuzione campionaria
\(\mu_1 - \mu_2\) \(\sigma^2_1, \sigma^2_2\) note
\(\mu_1 - \mu_2\) \(\sigma^2_1 = \sigma^2_2\) incognite
\(\mu_1 - \mu_2\) \(\sigma^2_1 \neq \sigma^2_2\) incognite
\(\sigma^2_1/\sigma^2_2\) \(\mu_1, \mu_2\) note
\(\sigma^2_1/\sigma^2_2\) \(\mu_1, \mu_2\) incognite
\(\pi_1 - \pi_2\)
NoteEsercizio 2

In un sondaggio su due città, si vuole confrontare la proporzione di residenti favorevoli a una nuova politica ambientale.

  • Città 1: \(n_1 = 200\) intervistati, \(x_1 = 94\) favorevoli
  • Città 2: \(n_2 = 180\) intervistati, \(x_2 = 72\) favorevoli
  1. Calcola le proporzioni campionarie \(\hat{\pi}_1\) e \(\hat{\pi}_2\) e la proporzione pooled \(\hat{\pi}_p = (x_1 + x_2)/(n_1 + n_2)\).

  2. Scrivi la statistica per il confronto tra \(\pi_1\) e \(\pi_2\), indicandone la distribuzione campionaria asintotica. Specifica sotto quali condizioni l’approssimazione normale è valida e verifica che siano soddisfatte in questo caso.

  3. Calcola il valore osservato della statistica e commenta: i dati forniscono evidenza di una differenza tra le proporzioni nelle due città?

Parte 2: esercizi in R

NoteEsercizio 3

Esplora in R la distribuzione \(F\) di Fisher e usala per completare l’analisi dell’Esercizio 1.

  1. Traccia in un grafico diviso in sei pannelli (\(2 \times 3\)) la densità della distribuzione \(F\) per le seguenti coppie di gradi di libertà: \((3, 3)\), \((5, 10)\), \((10, 10)\), \((10, 30)\), \((30, 30)\), \((50, 100)\). Usa la funzione df e adatta l’asse \(x\) a ciascun pannello. Aggiungi a ogni pannello il titolo con i gradi di libertà.

  2. Commenta la forma della distribuzione: come cambia al crescere dei gradi di libertà? Verso quale distribuzione sembra convergere per gradi di libertà molto grandi?

  3. Usando pf e qf, calcola per la distribuzione \(F(11, 14)\) dell’Esercizio 1:

    1. il quantile al 97.5%
    2. il quantile al 2.5% (ricorda la relazione \(F_{1-\alpha/2}(\nu_1, \nu_2) = 1/F_{\alpha/2}(\nu_2, \nu_1)\))
    3. la probabilità \(P(F \leq f_{\text{obs}})\), dove \(f_{\text{obs}}\) è il valore calcolato al punto (b) dell’Esercizio 1
NoteEsercizio 4

Usa il metodo Monte Carlo per confrontare la distribuzione campionaria della media e della mediana in due scenari con DGP diversi.

  1. Fissa \(B = 10\,000\) simulazioni e considera due DGP:

    • DGP normale: \(X \sim N(\mu = 5,\; \sigma^2 = 4)\)
    • DGP esponenziale: \(X \sim \text{Exp}(\text{rate} = 1/5)\) (media = 5, ma distribuzione asimmetrica)

    Per ciascun DGP e per ciascuna delle dimensioni campionarie \(n \in \{10, 50\}\), genera \(B\) campioni e calcola, per ognuno, sia la media che la mediana campionaria. Usa map_dbl di purrr per l’iterazione.

  2. Costruisci un grafico diviso in quattro pannelli (\(2 \times 2\): DGP sulle righe, \(n\) sulle colonne). In ogni pannello sovrapponi i due istogrammi (media in blu trasparente, mediana in rosso trasparente) usando lo stesso asse \(x\) per i due pannelli della stessa riga.

  3. Per ciascuno degli otto casi (2 DGP × 2 valori di \(n\) × 2 statistiche), riporta in una tabella: media delle \(B\) stime (prossima al vero \(\mu = 5\)?), deviazione standard delle \(B\) stime (errore standard empirico). Commenta:

    • Per il DGP normale, quale statistica ha errore standard minore? Il risultato è coerente con quanto ci aspettiamo dalla teoria?
    • Per il DGP esponenziale il risultato cambia? Perché?
TipSuggerimento

Per sovrapporre due istogrammi con trasparenza:

hist(medie,  col = rgb(0, 0, 1, 0.4), freq = FALSE, main = "", xlab = "")
hist(mediane, col = rgb(1, 0, 0, 0.4), freq = FALSE, add = TRUE)
legend("topright", legend = c("Media", "Mediana"),
       fill = c(rgb(0,0,1,0.4), rgb(1,0,0,0.4)))
NoteEsercizio 5

Usa il metodo bootstrap per stimare l’errore standard della mediana e confrontarlo con quello della media su un campione osservato.

  1. Genera un campione osservato di \(n = 30\) osservazioni da una distribuzione \(\text{Exp}(\text{rate} = 0{,}2)\) usando set.seed(42). Calcola la media e la mediana campionaria.

  2. Implementa il bootstrap con \(B = 5\,000\) ricampionamenti: per ogni ricampionamento (con reinserimento, stesso \(n\)) calcola media e mediana. Usa map_dbl per l’iterazione.

  3. Rappresenta le due distribuzioni bootstrap in un grafico a due pannelli affiancati. Aggiungi in ciascun pannello una linea verticale in corrispondenza della stima sul campione originale.

  4. Stima l’errore standard bootstrap di media e mediana e confrontali. Il risultato è coerente con quanto osservato nella simulazione Monte Carlo dell’Esercizio 4?

  5. Ripeti l’analisi dei punti (b)–(d) su un secondo campione di \(n = 30\) generato da una \(N(\mu = 5,\; \sigma^2 = 4)\) con set.seed(42). Come cambiano gli errori standard bootstrap rispetto al caso esponenziale? La differenza relativa tra i due (media vs mediana) va nella direzione attesa?

TipSuggerimento

Uno schema possibile per il bootstrap:

B        <- 5000
n        <- length(campione)
boot_med <- map_dbl(1:B, \(i) median(sample(campione, size = n, replace = TRUE)))

Consegna

  • Puoi inviare la tua soluzione scannerizzando i fogli relativi agli esercizi carta e penna, comprimendo il file ottenuto insieme al file .R in un file .zip e caricando il file in risposta al compito assegnato su Teams.

  • Puoi consegnare al docente il compito svolto in aula durante la lezione del martedì, stampando il file .R e consegnandolo insieme alle soluzioni agli esercizi numerici. In questo caso, in risposta al compito assegnato su Teams carica un file di testo o MS-Word scrivendo semplicemente consegnato in aula.

Valutazione

Totale punti disponibili: 110 punti

Componente Punti
Es 1 - 5 100
Workflow & formattazione 101

Footnotes

  1. La valutazione al “Workflow & formattazione” tiene conto:
    - per gli esercizi carta e penna, dell’ordine con cui svolgi gli esercizi e delle argomentazioni date alle risposte aperte
    - per gli esercizi su R, del principio di riproducibilità del codice: lo script caricato deve funzionare senza errori su qualunque PC dando gli stessi risultati↩︎