Seminar 3

Author

Carlos Buitrago

1 Метод моментов

Пусть \(X_1,\dots,X_n\) — независимая одинаково распределённая выборка из семейства распределений \(\{P_\theta:\theta\in\Theta\}\), где параметр \(\theta\) неизвестен.

Идея метода моментов: теоретические моменты распределения выражаются через неизвестный параметр, а затем заменяются соответствующими выборочными моментами.

1.1 Теоретические и выборочные моменты

\(k\)теоретическим моментом называется

\[ m_k(\theta)=\mathbb E_\theta X^k, \]

если это математическое ожидание существует.

Соответствующий выборочный момент имеет вид

\[ \widehat m_k=\frac1n\sum_{i=1}^n X_i^k. \]

Если параметр одномерный, обычно достаточно одного уравнения

\[ \widehat m_1=m_1(\theta). \]

Если \(\theta=(\theta_1,\dots,\theta_k)\)\(k\)-мерный параметр, используют систему

\[ \begin{cases} \widehat m_1=m_1(\theta),\\ \vdots\\ \widehat m_k=m_k(\theta). \end{cases} \]

Если отображение

\[ m:\Theta\to m(\Theta),\qquad m(\theta)=(m_1(\theta),\dots,m_k(\theta)) \]

обратимо, то оценка метода моментов записывается как

\[ \boxed{\widehat\theta_{\mathrm{MM}}=m^{-1}(\widehat m_1,\dots,\widehat m_k).} \]

Пусть

\[X_1,\dots,X_n\sim\operatorname{Pois}(\lambda).\]

Так как

\[\mathbb E X=\lambda,\]

приравниваем теоретический и выборочный моменты:

\[\overline X=\lambda.\]

Следовательно,

\[\boxed{\widehat\lambda_{\mathrm{MM}}=\overline X.}\]

Если \(X\sim U[0,\theta]\), то

\[\mathbb E X=\frac\theta2.\]

Поэтому

\[\overline X=\frac\theta2 \quad\Longrightarrow\quad \boxed{\widehat\theta_{\mathrm{MM}}=2\overline X.}\]

1.2 Обобщённая идея моментов

Не обязательно использовать только степени \(X^k\). Можно выбрать функцию \(g\) такую, что

\[m(\theta)=\mathbb E_\theta g(X)\]

существует и однозначно определяет \(\theta\). Тогда можно решить уравнение

\[ \frac1n\sum_{i=1}^n g(X_i)=m(\theta). \]

Это особенно полезно для тяжёлохвостых распределений, у которых обычные моменты могут не существовать.

1.3 Пример: распределение Коши

Пусть

\[X\sim\operatorname{Cauchy}(0,\theta),\qquad f_\theta(x)=\frac{\theta}{\pi(x^2+\theta^2)},\quad \theta>0.\]

Обычные положительные целые моменты распределения Коши не существуют. Возьмём вместо них ограниченную функцию

\[g(x)=\frac{x^2}{1+x^2}.\]

Тогда

\[ \mathbb E_\theta g(X) =\mathbb E_\theta\frac{X^2}{1+X^2} =\frac{\theta}{1+\theta}. \]

Обозначим

\[ M_n=\frac1n\sum_{i=1}^n\frac{X_i^2}{1+X_i^2}. \]

Из моментного уравнения

\[M_n=\frac\theta{1+\theta}\]

получаем

\[ \boxed{\widehat\theta=\frac{M_n}{1-M_n}}. \]

1.4 Сильная состоятельность оценки метода моментов

ImportantТеорема

Пусть

\[m:\Theta\to m(\Theta)\]

— биекция, причём функция \(m^{-1}\) определена и непрерывна в каждой точке множества \(m(\Theta)\). Предположим также, что

\[ \mathbb E_\theta |g_i(X_1)|<\infty, \qquad i=1,\dots,k, \]

для всех \(\theta\in\Theta\), где

\[m_i(\theta)=\mathbb E_\theta g_i(X_1).\]

Тогда оценка метода моментов является сильно состоятельной:

\[ \boxed{\widehat\theta_n\xrightarrow{a.s.}\theta.} \]

1.4.1 Почему это верно?

По усиленному закону больших чисел

\[ \frac1n\sum_{j=1}^n g_i(X_j) \xrightarrow{a.s.} \mathbb E_\theta g_i(X_1)=m_i(\theta). \]

Следовательно,

\[\widehat m_n\xrightarrow{a.s.}m(\theta).\]

По непрерывности \(m^{-1}\),

\[ \widehat\theta_n=m^{-1}(\widehat m_n) \xrightarrow{a.s.} m^{-1}(m(\theta))=\theta. \]

1.5 Асимптотическая нормальность оценки метода моментов

ImportantТеорема

В условиях предыдущей теоремы предположим дополнительно, что \(m^{-1}\) дифференцируема в точке \(m(\theta)\) и

\[ \mathbb E_\theta[g_i(X_1)^2]<\infty, \qquad i=1,\dots,k. \]

Тогда оценка метода моментов асимптотически нормальна.

Действительно, многомерная ЦПТ даёт

\[ \sqrt n\left(\widehat m_n-m(\theta)\right) \xrightarrow{d} \mathcal N_k(0,\Sigma), \]

где

\[ \Sigma=\operatorname{Cov}_\theta\bigl(g(X_1)\bigr). \]

Применяя многомерный дельта-метод к \(m^{-1}\), получаем

\[ \boxed{ \sqrt n(\widehat\theta_n-\theta) \xrightarrow{d} \mathcal N_k\left(0, D m^{-1}(m(\theta))\,\Sigma\,D m^{-1}(m(\theta))^\top \right). } \]

2 Квантили

2.1 Квантиль распределения

TipОпределение

Для \(p\in(0,1)\) величина

\[ \boxed{z_p=\inf\{x:F_P(x)\ge p\}} \]

называется \(p\)-квантилем распределения \(P\).

Например, при \(p=1/2\) получаем медиану распределения.

2.2 Выборочный квантиль

Пусть

\[X_{(1)}\le X_{(2)}\le\cdots\le X_{(n)}\]

— вариационный ряд выборки \(X_1,\dots,X_n\).

TipОпределение

Статистика

\[ z_{n,p}= \begin{cases} X_{(\lfloor np\rfloor+1)}, & np\notin\mathbb Z,\\[4pt] X_{(np)}, & np\in\mathbb Z, \end{cases} \]

называется выборочным \(p\)-квантилем.

2.3 Асимптотическая нормальность выборочного квантиля

ImportantТеорема

Пусть \(X_1,\dots,X_n\) — выборка из распределения \(P\) с плотностью \(\rho(x)\). Пусть \(z_p\)\(p\)-квантиль распределения, причём \(\rho\) непрерывна в точке \(z_p\) и

\[\rho(z_p)>0.\]

Тогда

\[ \boxed{ \sqrt n\,(z_{n,p}-z_p) \xrightarrow{d} \mathcal N\left(0,\frac{p(1-p)}{\rho^2(z_p)}\right). } \]

Отсюда, при больших \(n\),

\[ z_{n,p}\approx \mathcal N\left( z_p, \frac{p(1-p)}{n\rho^2(z_p)} \right). \]

2.4 Выборочная медиана

TipОпределение

Выборочной медианой для выборки \(X_1,\dots,X_n\) называется

\[ \widehat\mu= \begin{cases} X_{(k+1)}, & n=2k+1,\\[6pt] \dfrac{X_{(k)}+X_{(k+1)}}{2}, & n=2k. \end{cases} \]

Для непрерывного распределения с медианой \(\mu\) и плотностью \(\rho(\mu)>0\) теорема о выборочном квантиле при \(p=1/2\) даёт

\[ \boxed{ \sqrt n(\widehat\mu-\mu) \xrightarrow{d} \mathcal N\left(0,\frac{1}{4\rho^2(\mu)}\right). } \]

2.5 Пример: медиана нормального распределения

Пусть

\[X_i\sim\mathcal N(\mu,\sigma^2).\]

Медиана равна \(\mu\), а

\[ \rho(\mu)=\frac{1}{\sigma\sqrt{2\pi}}. \]

Поэтому

\[ \frac{1}{4\rho^2(\mu)} =\frac{\pi\sigma^2}{2}, \]

и

\[ \boxed{ \sqrt n(\widehat\mu-\mu) \xrightarrow{d} \mathcal N\left(0,\frac{\pi\sigma^2}{2}\right). } \]

Для сравнения,

\[ \sqrt n(\overline X-\mu) \xrightarrow{d}\mathcal N(0,\sigma^2). \]

Таким образом, при нормальной модели выборочное среднее асимптотически эффективнее медианы, но медиана значительно устойчивее к выбросам.

Show Python code
import numpy as np
import matplotlib.pyplot as plt

rng = np.random.default_rng(42)

mu, sigma = 0.0, 1.0
n = 100
R = 10_000

samples = rng.normal(mu, sigma, size=(R, n))
medians = np.median(samples, axis=1)
scaled = np.sqrt(n) * (medians - mu)

x = np.linspace(-4, 4, 500)
asymptotic_var = np.pi * sigma**2 / 2
asymptotic_density = (
    1 / np.sqrt(2 * np.pi * asymptotic_var)
    * np.exp(-x**2 / (2 * asymptotic_var))
)

plt.figure(figsize=(8, 5))
plt.hist(scaled, bins=60, density=True, alpha=0.6)
plt.plot(x, asymptotic_density, linewidth=2,
         label=r'$N(0,\pi\sigma^2/2)$')
plt.xlabel(r'$\sqrt{n}(\hat\mu-\mu)$')
plt.ylabel('Density')
plt.title('Асимптотическая нормальность выборочной медианы')
plt.legend()
plt.show()

3 Метод максимального правдоподобия

Пусть

\[\mathcal P=\{P_\theta:\theta\in\Theta\}\]

— доминируемое семейство распределений с плотностью \(\rho_\theta(x)\).

3.1 Функция правдоподобия

Для независимой одинаково распределённой выборки \(X_1,\dots,X_n\) совместная плотность имеет вид

\[ \boxed{ f_\theta(X_1,\dots,X_n) = \prod_{i=1}^n\rho_\theta(X_i). } \]

Если рассматривать наблюдения \(x_1,\dots,x_n\) как фиксированные, а \(\theta\) — как переменную, эта же функция называется функцией правдоподобия:

\[ L(\theta;x_1,\dots,x_n) = \prod_{i=1}^n\rho_\theta(x_i). \]

3.2 Логарифмическая функция правдоподобия

Вместо произведения обычно удобнее максимизировать его логарифм:

\[ \boxed{ \ell(\theta) = \log L(\theta) = \sum_{i=1}^n\log\rho_\theta(X_i). } \]

Поскольку логарифм строго возрастает,

\[ \arg\max_{\theta\in\Theta}L(\theta) = \arg\max_{\theta\in\Theta}\ell(\theta). \]

3.3 Оценка максимального правдоподобия

TipОпределение

Оценкой максимального правдоподобия (MLE) параметра \(\theta\) называется статистика

\[ \boxed{ \widehat\theta_{\mathrm{MLE}}(\mathbf X) \in \arg\max_{\theta\in\Theta} L(\theta;X_1,\dots,X_n). } \]

На практике обычно:

  1. записывают \(L(\theta)\);
  2. переходят к \(\ell(\theta)=\log L(\theta)\);
  3. находят критические точки из \(\ell'(\theta)=0\);
  4. проверяют границы пространства параметров и убеждаются, что найден максимум.

Важно: если пространство параметров дискретно, дифференцирование может быть неприменимо. Тогда удобно сравнивать соседние значения правдоподобия, например \(L(\theta+1)/L(\theta)\).

3.4 Пример: \(\operatorname{Bin}(m,p)\), параметр \(p\) неизвестен

Пусть

\[X_1,\dots,X_n\overset{iid}{\sim}\operatorname{Bin}(m,p),\]

где \(m\) известно. Тогда

\[ L(p) =\prod_{i=1}^n\binom{m}{X_i}p^{X_i}(1-p)^{m-X_i}. \]

С точностью до слагаемого, не зависящего от \(p\),

\[ \ell(p) = \left(\sum_{i=1}^nX_i\right)\log p + \left(nm-\sum_{i=1}^nX_i\right)\log(1-p). \]

Из \(\ell'(p)=0\) получаем

\[ \boxed{\widehat p_{\mathrm{MLE}}=\frac{\overline X}{m}.} \]

3.5 Пример: нормальное распределение

Пусть

\[X_1,\dots,X_n\sim\mathcal N(\mu,\sigma^2).\]

Если оба параметра неизвестны, максимизация логарифмического правдоподобия приводит к

\[ \boxed{\widehat\mu_{\mathrm{MLE}}=\overline X}, \]

и

\[ \boxed{ \widehat{\sigma^2}_{\mathrm{MLE}} =\frac1n\sum_{i=1}^n(X_i-\overline X)^2. } \]

Обратите внимание: MLE для \(\sigma^2\) использует делитель \(n\), а не \(n-1\), поэтому при конечном \(n\) эта оценка смещена.

4 Связь трёх идей

В этой части курса появляются три разных способа строить оценки:

  • метод моментов: сопоставляем теоретические и эмпирические средние некоторых функций \(g(X)\);
  • выборочные квантили: оцениваем положение распределения через порядковые статистики;
  • метод максимального правдоподобия: выбираем параметр, при котором наблюдённая выборка наиболее правдоподобна.

Эти методы могут приводить как к одинаковым, так и к различным оценкам. После построения оценки нас интересуют её свойства: состоятельность, смещение, дисперсия, асимптотическая нормальность и эффективность.