Problemi non regolari di verosimiglianza

Il modello Uniforme continuo su \((0, \theta)\)

Motivazione

Condizioni di regolarità

Nei modelli trattati finora (Bernoulli, Poisson, Normale) valgono le condizioni di regolarità:

  • il supporto non dipende dal parametro
  • la log-verosimiglianza è differenziabile in \(\hat\theta\)
  • l’equazione di score \(s(\theta) = 0\) individua la MV
  • l’approssimazione quadratica attorno a \(\hat\theta\) è valida

Cosa succede quando queste condizioni vengono meno?

Un esempio canonico

\[X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{U}(0, \theta), \quad \theta > 0\]

\[f(x \mid \theta) = \frac{1}{\theta} \cdot \mathbf{1}_{(0,\theta)}(x)\]

Differenza cruciale rispetto ai modelli regolari:

\[\{x : f(x\mid\theta) > 0\} = (0, \theta)\]

Il supporto dipende dal parametro \(\theta\). Questa è la radice di tutti i problemi che seguiranno.

La funzione di verosimiglianza

Calcolo

\[L(\theta) = \prod_{i=1}^n \frac{1}{\theta} \cdot \mathbf{1}_{(0,\theta)}(x_i) = \frac{1}{\theta^n} \cdot \prod_{i=1}^n \mathbf{1}_{(0,\theta)}(x_i)\]

Il prodotto delle indicatrici vale 1 se e solo se \(\theta \geq x_i\) per ogni \(i\), cioè \(\theta \geq x_{(n)} = \max_i x_i\):

\[\prod_{i=1}^n \mathbf{1}_{(0,\theta)}(x_i) = \mathbf{1}_{[x_{(n)},\,+\infty)}(\theta)\]

\[\boxed{L(\theta) = \begin{cases} \theta^{-n} & \text{se } \theta \geq x_{(n)} \\ 0 & \text{se } \theta < x_{(n)} \end{cases}}\]

Grafico della verosimiglianza

lik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, 0, theta^(-n))
}

set.seed(42)
dati <- c(runif(9, 0, 5), 4.8)
x_theta <- seq(0, 10, by = 0.001)

plot(x_theta, lik_unif(x_theta, dati),
     type = "l", col = "firebrick", lwd = 2.5,
     xlab = expression(theta),
     ylab = expression(L(theta)),
     main = expression("Verosimiglianza - U(0,"*theta*")"))
abline(v = max(dati), lty = 2, col = "steelblue", lwd = 2)
abline(v = 5, lty = 2, col = "darkgreen", lwd = 2)
legend("topright",
       legend = c(expression(hat(theta) == x[(n)]),
                  expression(theta[vero] == 5)),
       col = c("steelblue", "darkgreen"),
       lty = 2, lwd = 2, cex = 0.9)

Tre caratteristiche chiave: salto discontinuo in \(x_{(n)}\), decrescenza per \(\theta \geq x_{(n)}\), massimo nel punto di salto.

Stima di massima verosimiglianza

La MV si trova per ispezione

Poiché \(\theta^{-n}\) è strettamente decrescente, il massimo si trova nel punto più piccolo del dominio ammissibile:

\[\hat{\theta}_{\text{MV}} = x_{(n)} = \max_i x_i\]

Prima rottura

La MV non si trova risolvendo \(s(\theta) = 0\).
Si trova per ispezione geometrica della funzione di verosimiglianza.

L’equazione di score non funziona

La log-verosimiglianza per \(\theta \geq x_{(n)}\):

\[\ell(\theta) = -n \log \theta\]

La funzione di score:

\[s(\theta) = \frac{d\ell}{d\theta} = -\frac{n}{\theta} < 0 \quad \forall\, \theta > 0\]

\(s(\theta)\) è sempre negativa, non si annulla mai per \(\theta > 0\).

La MV si trova in un punto di non differenziabilità di \(L(\theta)\), non dove la derivata si annulla.

L’informazione osservata non è definita

Per \(\theta > x_{(n)}\):

\[j(\theta) = -\frac{d^2\ell}{d\theta^2} = \frac{n}{\theta^2}\]

Ma in \(\hat{\theta} = x_{(n)}\) la log-verosimiglianza ha una cuspide:

  • a sinistra: \(\ell(\theta) = -\infty\)
  • a destra: \(\ell(\theta) = -n\log\theta\)

\(\Rightarrow\) \(j(\hat\theta)\) non è definita.

L’approssimazione quadratica è inapplicabile

Nei modelli regolari si costruisce la parabola:

\[\ell(\theta) \approx \ell(\hat\theta) - \frac{1}{2}(\theta - \hat\theta)^2\, j(\hat\theta)\]

Qui la log-verosimiglianza ha una cuspide in \(\hat\theta\): non è possibile costruire una parabola centrata in \(\hat\theta\).

La log-verosimiglianza relativa \(r(\theta)\) non converge ad una forma gaussiana al crescere di \(n\).

Proprietà della MV

Distribuzione esatta di \(X_{(n)}\)

\[F_{X_{(n)}}(t) = P(X_{(n)} \leq t) = \left(\frac{t}{\theta}\right)^n, \quad 0 \leq t \leq \theta\]

\[f_{X_{(n)}}(t) = \frac{n\, t^{n-1}}{\theta^n}, \quad 0 \leq t \leq \theta\]

La distribuzione è disponibile in forma esatta: non serve la teoria asintotica dei modelli regolari.

Distorsione

\[E[X_{(n)}] = \int_0^\theta t \cdot \frac{n t^{n-1}}{\theta^n}\, dt = \frac{n}{n+1}\,\theta \neq \theta\]

\(X_{(n)}\) è distorto verso il basso: la distorsione è \(-\dfrac{\theta}{n+1}\).

Non può mai superare \(\theta\) per costruzione \(\Rightarrow\) sottostima sistematica.

Lo stimatore corretto:

\[\tilde{\theta} = \frac{n+1}{n}\, X_{(n)}\]

Velocità di convergenza

Modelli regolari:

\[\sqrt{n}\,(\hat\theta - \theta_0) \xrightarrow{d} N\!\left(0,\; \frac{1}{i(\theta_0)}\right)\]

Modello Uniforme:

\[n\,(\theta - X_{(n)}) \xrightarrow{d} \text{Exp}(\theta)\]

La convergenza avviene a velocità \(n\), molto più rapida. Ogni nuova osservazione può portare informazione sulla frontiera del supporto, qualcosa di strutturalmente impossibile nei modelli regolari.

Verosimiglianza relativa

Definizione

Per \(\theta \geq x_{(n)}\):

\[R(\theta) = \frac{L(\theta)}{L(\hat\theta)} = \left(\frac{x_{(n)}}{\theta}\right)^n\]

\[r(\theta) = \ell(\theta) - \ell(\hat\theta) = n\log\frac{x_{(n)}}{\theta}\]

Per \(\theta < x_{(n)}\): \(R(\theta) = 0\) e \(r(\theta) = -\infty\).

Massimo in \(\hat\theta = x_{(n)}\): \(R(\hat\theta) = 1\), \(r(\hat\theta) = 0\).

Verosimiglianza relativa al variare di \(n\)

rel_lik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, 0, (x_max / theta)^n)
}

theta_vero  <- 5
x_max_fisso <- 4.8
numerosita  <- c(5, 10, 30, 100)
colori <- c("firebrick","steelblue","darkgreen","purple")
set.seed(42)

x_theta <- seq(4, 10, by = 0.001)
plot(NULL, xlim = c(4, 10), ylim = c(0, 1),
     xlab = expression(theta),
     ylab = expression(R(theta)),
     main = "Verosimiglianza relativa")
for (k in seq_along(numerosita)) {
  n <- numerosita[k]
  dati <- c(runif(n - 1, 0, x_max_fisso), x_max_fisso)
  lines(x_theta, rel_lik_unif(x_theta, dati),
        col = colori[k], lwd = 2)
}
abline(v = theta_vero,  lty = 2, col = "black",  lwd = 1.5)
abline(v = x_max_fisso, lty = 3, col = "gray40", lwd = 1.5)
legend("topright",
       legend = c(paste0("n = ", numerosita),
                  expression(theta[vero]), expression(x[(n)])),
       col = c(colori, "black", "gray40"),
       lty = c(1,1,1,1,2,3), lwd = 2, cex = 0.8)

Log-verosimiglianza relativa al variare di \(n\)

rel_loglik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, -Inf, n * log(x_max / theta))
}

plot(NULL, xlim = c(4, 10), ylim = c(-10, 0),
     xlab = expression(theta),
     ylab = expression(r(theta)),
     main = "Log-verosimiglianza relativa")
for (k in seq_along(numerosita)) {
  n <- numerosita[k]
  dati <- c(runif(n - 1, 0, x_max_fisso), x_max_fisso)
  lines(x_theta, rel_loglik_unif(x_theta, dati),
        col = colori[k], lwd = 2)
}
abline(v = theta_vero,  lty = 2, col = "black",  lwd = 1.5)
abline(v = x_max_fisso, lty = 3, col = "gray40", lwd = 1.5)
abline(h = 0,           lty = 3, col = "gray60")
legend("topright",
       legend = c(paste0("n = ", numerosita),
                  expression(theta[vero]), expression(x[(n)])),
       col = c(colori, "black", "gray40"),
       lty = c(1,1,1,1,2,3), lwd = 2, cex = 0.8)

Cosa si rompe nell’Uniforme

Condizione di regolarità Uniforme Conseguenza
Supporto non dipende da \(\theta\) ✗ Score non individua la MV
\(\ell(\theta)\) differenziabile in \(\hat\theta\) ✗ \(j(\hat\theta)\) non definita
Approssimazione quadratica valida ✗ Nessuna forma gaussiana
Convergenza a velocità \(\sqrt{n}\) ✗ Convergenza a velocità \(n\)

Messaggio finale

La funzione di verosimiglianza contiene ancora tutta l’informazione necessaria:

  • la MV si trova per ispezione geometrica
  • le proprietà di \(\hat\theta\) si derivano direttamente dalla distribuzione di \(X_{(n)}\)
  • la distribuzione esatta è disponibile, senza ricorrere all’approssimazione asintotica

Ma gli strumenti analitici sviluppati per i modelli regolari non funzionano.

La non regolarità non è un’eccezione curiosa: è un promemoria di quanto le condizioni di regolarità facciano davvero lavoro nella teoria generale.