Seminar 2: Статистики и оценки, их свойства

Author

Carlos Buitrago

1 Вероятностно-статистическая модель

Пусть \(X\) — случайная величина или случайный вектор со значениями в измеримом пространстве \((\mathcal X,\mathcal B(\mathcal X))\). Предполагается, что распределение \(P\) случайной величины \(X\) неизвестно, но известно, что

\[ P\in\mathcal P, \]

где \(\mathcal P\) — заданное семейство вероятностных распределений. Тройка \((\mathcal X,\mathcal B(\mathcal X),\mathcal P)\) называется статистической моделью.

1.1 Параметрическая статистическая модель

Если семейство распределений можно записать в виде

\[ \mathcal P = \{P_\theta:\theta\in\Theta\}, \]

где \(\Theta\) — параметрическое пространство, то модель называется параметрической.

Параметр \(\theta\in\Theta\) считается неизвестным.

Задача статистического оценивания состоит в восстановлении самого параметра \(\theta\) или некоторой его функции \(\tau(\theta)\).

NoteВыборка

Пусть \(X_1,\ldots,X_n\) — независимые одинаково распределённые случайные величины с распределением \(P_\theta\). Вектор

\[ X=(X_1,\ldots,X_n) \]

называется выборкой размера \(n\) из распределения \(P_\theta\).

Кратко пишут \(X_1,\ldots,X_n \overset{\mathrm{i.i.d.}}{\sim} P_\theta\). Если каждый элемент выборки принимает значения в \(\mathcal X\), то вся выборка принимает значения в \(\mathcal X^n\).

При истинном значении параметра \(\theta\) совместное распределение выборки равно

\[ P_\theta^{\,n} = \underbrace{ P_\theta\otimes\cdots\otimes P_\theta }_{n\text{ раз}}. \]

NoteСтатистика

Пусть \((\mathcal Y,\mathcal E)\) — измеримое пространство. Любое измеримое отображение

\[ S:\mathcal X^n\to\mathcal Y \]

называется статистикой.

Таким образом, \(S=S(X_1,\ldots,X_n)\) — это любая измеримая функция от выборки, не зависящая от неизвестного параметра.

NoteОценка

Пусть параметрическая модель задаётся семейством распределений \(\mathcal P=\{P_\theta:\theta\in\Theta\}\), и требуется оценить параметрическую функцию

\[ \tau:\Theta\to\mathcal T. \]

Оценкой величины \(\tau(\theta)\) называется статистика

\[ \widehat{\tau}_n = \widehat{\tau}_n(X_1,\ldots,X_n), \]

принимающая значения в пространстве \(\mathcal T\) значений параметрической функции \(\tau\).

Иными словами, оценка является статистикой, значения которой лежат в том же пространстве, что и оцениваемая величина \(\tau(\theta)\).

2 Примеры статистик

Пусть \(g:\mathcal X\to\mathbb R\) — борелевская функция.

Статистика

\[ \boxed{ \overline{g(X)} = \frac1n \sum_{i=1}^n g(X_i) } \]

называется выборочной характеристикой, соответствующей функции \(g\).

Если \(\mathbb E_\theta|g(X_1)|<\infty\), то по закону больших чисел

\[ \overline{g(X)} \xrightarrow{\mathbb P_\theta} \mathbb E_\theta g(X_1). \]

NoteВыборочное среднее

При \(g(x)=x\) получаем выборочное среднее

\[ \overline X = \frac1n \sum_{i=1}^n X_i. \]

NoteВыборочные моменты

Для \(k\in\mathbb N\) величина

\[ \boxed{ \overline{X^k} = \frac1n \sum_{i=1}^n X_i^k } \]

называется выборочным моментом порядка \(k\).

Соответствующий теоретический момент обозначим \(m_k(\theta)=\mathbb E_\theta X_1^k\).

Если \(\mathbb E_\theta|X_1|^k<\infty\), то

\[ \overline{X^k} \xrightarrow{\mathbb P_\theta} m_k(\theta). \]

Если \(\mathbb E_\theta|X_1|^{2k}<\infty\), то центральная предельная теорема даёт

\[ \sqrt n \left( \overline{X^k} - \mathbb E_\theta X_1^k \right) \xrightarrow{d_\theta} N \left( 0, \operatorname{Var}_\theta(X_1^k) \right). \]

Кроме того,

\[ \mathbb E_\theta\overline{X^k} = \mathbb E_\theta X_1^k. \]

Следовательно, выборочный момент является одновременно:

  • несмещённой оценкой теоретического момента;
  • состоятельной оценкой;
  • при наличии момента порядка \(2k\) — асимптотически нормальной оценкой.
NoteПорядковые статистики

Упорядочим элементы выборки:

\[ X_{(1)} \leq X_{(2)} \leq \cdots \leq X_{(n)}. \]

Статистики \(X_{(1)},\ldots,X_{(n)}\) называются порядковыми статистиками, а вся совокупность называется вариационным рядом.

В частности,

\[ X_{(1)} = \min_{1\leq i\leq n}X_i, \]

\[ X_{(n)} = \max_{1\leq i\leq n}X_i. \]

\[ F_{X_{(n)}}(x) = F(x)^n. \]

\[ F_{X_{(1)}}(x) = 1-(1-F(x))^n. \]

NoteВыборочная дисперсия

Статистика

\[ s_n^2 = \frac1n \sum_{i=1}^n (X_i-\overline X)^2, \]

называется выборочной дисперсией.

Используя тождество \(\sum_{i=1}^n(X_i-\overline X)^2=\sum_{i=1}^n X_i^2-n\overline X^2\), получаем

\[ s_n^2 = \overline{X^2} - \overline X^2. \]

3 Cвойства точечных оценок

NoteНесмещенность

Оценка \(\widehat{\tau}_n\) называется несмещённой оценкой параметрической функции \(\tau(\theta)\), если

\[ \mathbb E_\theta\widehat{\tau}_n = \tau(\theta) \qquad \forall\theta\in\Theta. \]

В частности, \(\widehat\theta_n\) является несмещённой оценкой параметра \(\theta\), если \(\mathbb E_\theta\widehat\theta_n=\theta\).

Смещением оценки \(\widehat{\tau}_n\) называется величина

\[ \operatorname{Bias}_\theta(\widehat{\tau}_n) = \mathbb E_\theta\widehat{\tau}_n-\tau(\theta). \]

NoteСостоятельность

Последовательность оценок \(\widehat{\tau}_n\) называется состоятельной оценкой \(\tau(\theta)\), если для любого \(\theta\in\Theta\)

\[ \widehat{\tau}_n \xrightarrow{\mathbb P_\theta} \tau(\theta), \qquad n\to\infty. \]

NoteСильно состоятельная оценка

Последовательность оценок \(\widehat{\tau}_n\) называется сильно состоятельной, если для любого \(\theta\in\Theta\)

\[ \widehat{\tau}_n \xrightarrow{\text{п.н.}} \tau(\theta). \]

NoteАсимптотическая нормальность

Оценка \(\widehat{\tau}_n\) называется асимптотически нормальной оценкой \(\tau(\theta)\) с асимптотической дисперсией \(\sigma^2(\theta)\), если

\[ \sqrt n \left( \widehat{\tau}_n-\tau(\theta) \right) \xrightarrow{d_\theta} N \left( 0,\sigma^2(\theta) \right). \]

Функция \(\sigma^2(\theta)\) называется асимптотической дисперсией оценки.

3.1 Наследование свойств

TipНаследование состоятельности

Пусть

\[ \widehat{\theta}_n \xrightarrow{\mathbb P} \theta \]

и функция \(\tau\) непрерывна в точке \(\theta\). Тогда по теореме о непрерывном отображении

\[ \tau(\widehat{\theta}_n) \xrightarrow{\mathbb P} \tau(\theta). \]

TipНаследование сильной состоятельности

Если

\[ \widehat{\theta}_n \xrightarrow{\text{п.н.}} \theta \]

и \(\tau\) непрерывна в точке \(\theta\), то

\[ \tau(\widehat{\theta}_n) \xrightarrow{\text{п.н.}} \tau(\theta). \]

TipНаследование асимптотической нормальности

Пусть

\[ \sqrt n (\widehat{\theta}_n-\theta) \xrightarrow{d} N \left( 0,\sigma^2(\theta) \right), \]

а функция \(\tau\) дифференцируема в точке \(\theta\). Тогда по дельта-методу

\[ \sqrt n \left( \tau(\widehat{\theta}_n)-\tau(\theta) \right) \xrightarrow{d} N \left( 0, \sigma^2(\theta) [\tau'(\theta)]^2 \right). \]

4 Важные результаты

Связь между свойствами статистических оценок

4.1 Всегда ли существует несмещённая оценка?

Несмещённость является естественным и желательным свойством оценки. Однако несмещённая оценка заданной параметрической функции существует не всегда.

Рассмотрим простой пример. Пусть

\[ X_1,\ldots,X_n \overset{\mathrm{i.i.d.}}{\sim} \operatorname{Bernoulli}(\theta), \qquad \theta\in(0,1), \]

и предположим, что требуется оценить параметрическую функцию

\[ \tau(\theta)=\frac{1}{\theta}. \]

Можно показать, что несмещённой оценки \(\tau(\theta)\) не существует.

4.2 Всегда ли несмещённые оценки полезны?

Даже если несмещённая оценка существует, это ещё не означает, что она обладает хорошими статистическими свойствами.

Рассмотрим следующий пример. Пусть имеется всего одно наблюдение \(X_1\) с распределением

\[ \mathbb P_\theta(X_1=k) = \theta^k(1-\theta), \qquad k\in\mathbb Z_+, \qquad \theta\in(0,1). \]

Несмещённая оценка имеет вид

\[ \widehat\theta = \mathbf 1_{\{X_1\geq1\}}. \]

Действительно,

\[ \mathbb E_\theta\widehat\theta = \mathbb P_\theta(X_1\geq1) = 1-\mathbb P_\theta(X_1=0) = \theta. \]

Однако несмещённость сама по себе ещё ничего не говорит о точности оценки.

5 Полезные результаты для решения задач

Пусть \(X\sim U(0,\theta)\).

Тогда для любого \(k>-1\)

\[ \mathbb E X^k = \frac{\theta^k}{k+1}. \]

5.0.1 Минимум и максимум равномерной выборки

Пусть \(X_1,\ldots,X_n\overset{\mathrm{i.i.d.}}{\sim}U(0,\theta)\).

Для \(0\leq x\leq\theta\), выполнено \(\mathbb P_\theta(X_{(n)}\leq x)=\left(\frac{x}{\theta}\right)^n\).

Следовательно,

\[ \frac{X_{(n)}}{\theta} \sim \operatorname{Beta}(n,1). \]

Для минимума выполнено \(\mathbb P_\theta(X_{(1)}>x)=\left(1-\frac{x}{\theta}\right)^n\).

Следовательно,

\[ \frac{X_{(1)}}{\theta} \sim \operatorname{Beta}(1,n). \]

Из свойств бета-распределения следуют формулы

\[ \boxed{ \mathbb E_\theta X_{(1)} = \frac{\theta}{n+1}, } \]

\[ \boxed{ \mathbb E_\theta X_{(n)} = \frac{n}{n+1}\theta. } \]

5.0.2 Предельное распределение максимума

Рассмотрим

\[ Y_n = \frac{n}{\theta} \left( \theta-X_{(n)} \right). \]

Тогда для \(x\geq0\)

\[ \begin{aligned} \mathbb P(Y_n>x) &= \mathbb P \left( X_{(n)} < \theta\left(1-\frac{x}{n}\right) \right) = \left( 1-\frac{x}{n} \right)^n \longrightarrow e^{-x}. \end{aligned} \]

Следовательно,

\[ \frac{n}{\theta} \left( \theta-X_{(n)} \right) \xrightarrow{d} \operatorname{Exp}(1). \]

Аналогично для минимума

\[ \frac{n}{\theta}X_{(1)} \xrightarrow{d} \operatorname{Exp}(1). \]

Пусть \(X\sim\operatorname{Exp}(\theta)\) в параметризации по интенсивности:

\[ f_\theta(x) = \theta e^{-\theta x}, \qquad x\geq0. \]

Тогда для любого \(k\in\mathbb N\)

\[ \mathbb EX^k = \frac{k!}{\theta^k}. \]