Problemi non regolari di verosimiglianza

Il modello Uniforme continuo su \((0, \theta)\)

Motivazione

Condizioni di regolarità

Nei modelli trattati finora (Bernoulli, Poisson, Normale) valgono le condizioni di regolarità:

  • il supporto non dipende dal parametro
  • la log-verosimiglianza è differenziabile in \(\hat\theta\)
  • l’equazione di score \(s(\theta) = 0\) individua la MV
  • l’approssimazione quadratica attorno a \(\hat\theta\) è valida

Cosa succede quando queste condizioni vengono meno?

Un esempio canonico

\[X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{U}(0, \theta), \quad \theta > 0\]

\[f(x \mid \theta) = \frac{1}{\theta} \cdot \mathbf{1}_{(0,\theta)}(x)\]

Differenza cruciale rispetto ai modelli regolari:

\[\{x : f(x\mid\theta) > 0\} = (0, \theta)\]

Il supporto dipende dal parametro \(\theta\). Questa è la radice di tutti i problemi che seguiranno.

La funzione di verosimiglianza

Calcolo

\[L(\theta) = \prod_{i=1}^n \frac{1}{\theta} \cdot \mathbf{1}_{(0,\theta)}(x_i) = \frac{1}{\theta^n} \cdot \prod_{i=1}^n \mathbf{1}_{(0,\theta)}(x_i)\]

Il prodotto delle indicatrici vale 1 se e solo se \(\theta \geq x_i\) per ogni \(i\), cioè \(\theta \geq x_{(n)} = \max_i x_i\):

\[\prod_{i=1}^n \mathbf{1}_{(0,\theta)}(x_i) = \mathbf{1}_{[x_{(n)},\,+\infty)}(\theta)\]

\[\boxed{L(\theta) = \begin{cases} \theta^{-n} & \text{se } \theta \geq x_{(n)} \\ 0 & \text{se } \theta < x_{(n)} \end{cases}}\]

Grafico della verosimiglianza

lik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, 0, theta^(-n))
}

set.seed(42)
dati <- c(runif(9, 0, 5), 4.8)
x_theta <- seq(0, 10, by = 0.001)

plot(x_theta, lik_unif(x_theta, dati),
     type = "l", col = "firebrick", lwd = 2.5,
     xlab = expression(theta),
     ylab = expression(L(theta)),
     main = expression("Verosimiglianza - U(0,"*theta*")"))
abline(v = max(dati), lty = 2, col = "steelblue", lwd = 2)
abline(v = 5, lty = 2, col = "darkgreen", lwd = 2)
legend("topright",
       legend = c(expression(hat(theta) == x[(n)]),
                  expression(theta[vero] == 5)),
       col = c("steelblue", "darkgreen"),
       lty = 2, lwd = 2, cex = 0.9)

Tre caratteristiche chiave: salto discontinuo in \(x_{(n)}\), decrescenza per \(\theta \geq x_{(n)}\), massimo nel punto di salto.

Stima di massima verosimiglianza

La MV si trova per ispezione

Poiché \(\theta^{-n}\) è strettamente decrescente, il massimo si trova nel punto più piccolo del dominio ammissibile:

\[\hat{\theta}_{\text{MV}} = x_{(n)} = \max_i x_i\]

Prima rottura

La MV non si trova risolvendo \(s(\theta) = 0\).
Si trova per ispezione geometrica della funzione di verosimiglianza.

L’equazione di score non funziona

La log-verosimiglianza per \(\theta \geq x_{(n)}\):

\[\ell(\theta) = -n \log \theta\]

La funzione di score:

\[s(\theta) = \frac{d\ell}{d\theta} = -\frac{n}{\theta} < 0 \quad \forall\, \theta > 0\]

\(s(\theta)\) è sempre negativa, non si annulla mai per \(\theta > 0\).

La MV si trova in un punto di non differenziabilità di \(L(\theta)\), non dove la derivata si annulla.

L’informazione osservata non è definita

Per \(\theta > x_{(n)}\):

\[j(\theta) = -\frac{d^2\ell}{d\theta^2} = \frac{n}{\theta^2}\]

Ma in \(\hat{\theta} = x_{(n)}\) la log-verosimiglianza ha una cuspide:

  • a sinistra: \(\ell(\theta) = -\infty\)
  • a destra: \(\ell(\theta) = -n\log\theta\)

\(\Rightarrow\) \(j(\hat\theta)\) non è definita.

L’approssimazione quadratica è inapplicabile

Nei modelli regolari si costruisce la parabola:

\[\ell(\theta) \approx \ell(\hat\theta) - \frac{1}{2}(\theta - \hat\theta)^2\, j(\hat\theta)\]

Qui la log-verosimiglianza ha una cuspide in \(\hat\theta\): non è possibile costruire una parabola centrata in \(\hat\theta\).

La log-verosimiglianza relativa \(r(\theta)\) non converge ad una forma gaussiana al crescere di \(n\).

Proprietà della MV

Distribuzione esatta di \(X_{(n)}\)

\[F_{X_{(n)}}(t) = P(X_{(n)} \leq t) = \left(\frac{t}{\theta}\right)^n, \quad 0 \leq t \leq \theta\]

\[f_{X_{(n)}}(t) = \frac{n\, t^{n-1}}{\theta^n}, \quad 0 \leq t \leq \theta\]

La distribuzione è disponibile in forma esatta: non serve la teoria asintotica dei modelli regolari.

Distorsione

\[E[X_{(n)}] = \int_0^\theta t \cdot \frac{n t^{n-1}}{\theta^n}\, dt = \frac{n}{n+1}\,\theta \neq \theta\]

\(X_{(n)}\) è distorto verso il basso: la distorsione è \(-\dfrac{\theta}{n+1}\).

Non può mai superare \(\theta\) per costruzione \(\Rightarrow\) sottostima sistematica.

Lo stimatore corretto:

\[\tilde{\theta} = \frac{n+1}{n}\, X_{(n)}\]

Velocità di convergenza

Modelli regolari:

\[\sqrt{n}\,(\hat\theta - \theta_0) \xrightarrow{d} N\!\left(0,\; \frac{1}{i(\theta_0)}\right)\]

Modello Uniforme:

\[n\,(\theta - X_{(n)}) \xrightarrow{d} \text{Exp}(\theta)\]

La convergenza avviene a velocità \(n\), molto più rapida. Ogni nuova osservazione può portare informazione sulla frontiera del supporto, qualcosa di strutturalmente impossibile nei modelli regolari.

Verosimiglianza relativa

Definizione

Per \(\theta \geq x_{(n)}\):

\[R(\theta) = \frac{L(\theta)}{L(\hat\theta)} = \left(\frac{x_{(n)}}{\theta}\right)^n\]

\[r(\theta) = \ell(\theta) - \ell(\hat\theta) = n\log\frac{x_{(n)}}{\theta}\]

Per \(\theta < x_{(n)}\): \(R(\theta) = 0\) e \(r(\theta) = -\infty\).

Massimo in \(\hat\theta = x_{(n)}\): \(R(\hat\theta) = 1\), \(r(\hat\theta) = 0\).

Verosimiglianza relativa al variare di \(n\)

rel_lik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, 0, (x_max / theta)^n)
}

theta_vero  <- 5
x_max_fisso <- 4.8
numerosita  <- c(5, 10, 30, 100)
colori <- c("firebrick","steelblue","darkgreen","purple")
set.seed(42)

x_theta <- seq(4, 10, by = 0.001)
plot(NULL, xlim = c(4, 10), ylim = c(0, 1),
     xlab = expression(theta),
     ylab = expression(R(theta)),
     main = "Verosimiglianza relativa")
for (k in seq_along(numerosita)) {
  n <- numerosita[k]
  dati <- c(runif(n - 1, 0, x_max_fisso), x_max_fisso)
  lines(x_theta, rel_lik_unif(x_theta, dati),
        col = colori[k], lwd = 2)
}
abline(v = theta_vero,  lty = 2, col = "black",  lwd = 1.5)
abline(v = x_max_fisso, lty = 3, col = "gray40", lwd = 1.5)
legend("topright",
       legend = c(paste0("n = ", numerosita),
                  expression(theta[vero]), expression(x[(n)])),
       col = c(colori, "black", "gray40"),
       lty = c(1,1,1,1,2,3), lwd = 2, cex = 0.8)

Log-verosimiglianza relativa al variare di \(n\)

rel_loglik_unif <- function(theta, campione) {
  n <- length(campione)
  x_max <- max(campione)
  ifelse(theta < x_max, -Inf, n * log(x_max / theta))
}

plot(NULL, xlim = c(4, 10), ylim = c(-10, 0),
     xlab = expression(theta),
     ylab = expression(r(theta)),
     main = "Log-verosimiglianza relativa")
for (k in seq_along(numerosita)) {
  n <- numerosita[k]
  dati <- c(runif(n - 1, 0, x_max_fisso), x_max_fisso)
  lines(x_theta, rel_loglik_unif(x_theta, dati),
        col = colori[k], lwd = 2)
}
abline(v = theta_vero,  lty = 2, col = "black",  lwd = 1.5)
abline(v = x_max_fisso, lty = 3, col = "gray40", lwd = 1.5)
abline(h = 0,           lty = 3, col = "gray60")
legend("topright",
       legend = c(paste0("n = ", numerosita),
                  expression(theta[vero]), expression(x[(n)])),
       col = c(colori, "black", "gray40"),
       lty = c(1,1,1,1,2,3), lwd = 2, cex = 0.8)

Cosa si rompe nell’Uniforme

Condizione di regolarità Uniforme Conseguenza
Supporto non dipende da \(\theta\) Score non individua la MV
\(\ell(\theta)\) differenziabile in \(\hat\theta\) \(j(\hat\theta)\) non definita
Approssimazione quadratica valida Nessuna forma gaussiana
Convergenza a velocità \(\sqrt{n}\) Convergenza a velocità \(n\)

Messaggio finale

La funzione di verosimiglianza contiene ancora tutta l’informazione necessaria:

  • la MV si trova per ispezione geometrica
  • le proprietà di \(\hat\theta\) si derivano direttamente dalla distribuzione di \(X_{(n)}\)
  • la distribuzione esatta è disponibile, senza ricorrere all’approssimazione asintotica

Ma gli strumenti analitici sviluppati per i modelli regolari non funzionano.

La non regolarità non è un’eccezione curiosa: è un promemoria di quanto le condizioni di regolarità facciano davvero lavoro nella teoria generale.