Вероятностно-статистическая модель
Пусть \(X\) — случайная величина или случайный вектор со значениями в измеримом пространстве \((\mathcal X,\mathcal B(\mathcal X))\). Предполагается, что распределение \(P\) случайной величины \(X\) неизвестно, но известно, что
\[
P\in\mathcal P,
\]
где \(\mathcal P\) — заданное семейство вероятностных распределений. Тройка \((\mathcal X,\mathcal B(\mathcal X),\mathcal P)\) называется статистической моделью.
Параметрическая статистическая модель
Если семейство распределений можно записать в виде
\[
\mathcal P
=
\{P_\theta:\theta\in\Theta\},
\]
где \(\Theta\) — параметрическое пространство, то модель называется параметрической.
Параметр \(\theta\in\Theta\) считается неизвестным.
Задача статистического оценивания состоит в восстановлении самого параметра \(\theta\) или некоторой его функции \(\tau(\theta)\).
Пусть \(X_1,\ldots,X_n\) — независимые одинаково распределённые случайные величины с распределением \(P_\theta\). Вектор
\[
X=(X_1,\ldots,X_n)
\]
называется выборкой размера \(n\) из распределения \(P_\theta\).
Кратко пишут \(X_1,\ldots,X_n \overset{\mathrm{i.i.d.}}{\sim} P_\theta\). Если каждый элемент выборки принимает значения в \(\mathcal X\), то вся выборка принимает значения в \(\mathcal X^n\).
При истинном значении параметра \(\theta\) совместное распределение выборки равно
\[
P_\theta^{\,n}
=
\underbrace{
P_\theta\otimes\cdots\otimes P_\theta
}_{n\text{ раз}}.
\]
Пусть \((\mathcal Y,\mathcal E)\) — измеримое пространство. Любое измеримое отображение
\[
S:\mathcal X^n\to\mathcal Y
\]
называется статистикой.
Таким образом, \(S=S(X_1,\ldots,X_n)\) — это любая измеримая функция от выборки, не зависящая от неизвестного параметра.
Пусть параметрическая модель задаётся семейством распределений \(\mathcal P=\{P_\theta:\theta\in\Theta\}\), и требуется оценить параметрическую функцию
\[
\tau:\Theta\to\mathcal T.
\]
Оценкой величины \(\tau(\theta)\) называется статистика
\[
\widehat{\tau}_n
=
\widehat{\tau}_n(X_1,\ldots,X_n),
\]
принимающая значения в пространстве \(\mathcal T\) значений параметрической функции \(\tau\).
Иными словами, оценка является статистикой, значения которой лежат в том же пространстве, что и оцениваемая величина \(\tau(\theta)\).
Примеры статистик
Пусть \(g:\mathcal X\to\mathbb R\) — борелевская функция.
Статистика
\[
\boxed{
\overline{g(X)}
=
\frac1n
\sum_{i=1}^n g(X_i)
}
\]
называется выборочной характеристикой, соответствующей функции \(g\).
Если \(\mathbb E_\theta|g(X_1)|<\infty\), то по закону больших чисел
\[
\overline{g(X)}
\xrightarrow{\mathbb P_\theta}
\mathbb E_\theta g(X_1).
\]
При \(g(x)=x\) получаем выборочное среднее
\[
\overline X
=
\frac1n
\sum_{i=1}^n X_i.
\]
Для \(k\in\mathbb N\) величина
\[
\boxed{
\overline{X^k}
=
\frac1n
\sum_{i=1}^n X_i^k
}
\]
называется выборочным моментом порядка \(k\).
Соответствующий теоретический момент обозначим \(m_k(\theta)=\mathbb E_\theta X_1^k\).
Если \(\mathbb E_\theta|X_1|^k<\infty\), то
\[
\overline{X^k}
\xrightarrow{\mathbb P_\theta}
m_k(\theta).
\]
Если \(\mathbb E_\theta|X_1|^{2k}<\infty\), то центральная предельная теорема даёт
\[
\sqrt n
\left(
\overline{X^k}
-
\mathbb E_\theta X_1^k
\right)
\xrightarrow{d_\theta}
N
\left(
0,
\operatorname{Var}_\theta(X_1^k)
\right).
\]
Кроме того,
\[
\mathbb E_\theta\overline{X^k}
=
\mathbb E_\theta X_1^k.
\]
Следовательно, выборочный момент является одновременно:
- несмещённой оценкой теоретического момента;
- состоятельной оценкой;
- при наличии момента порядка \(2k\) — асимптотически нормальной оценкой.
Упорядочим элементы выборки:
\[
X_{(1)}
\leq
X_{(2)}
\leq
\cdots
\leq
X_{(n)}.
\]
Статистики \(X_{(1)},\ldots,X_{(n)}\) называются порядковыми статистиками, а вся совокупность называется вариационным рядом.
В частности,
\[
X_{(1)}
=
\min_{1\leq i\leq n}X_i,
\]
\[
X_{(n)}
=
\max_{1\leq i\leq n}X_i.
\]
\[
F_{X_{(n)}}(x)
=
F(x)^n.
\]
\[
F_{X_{(1)}}(x)
=
1-(1-F(x))^n.
\]
Статистика
\[
s_n^2
=
\frac1n
\sum_{i=1}^n
(X_i-\overline X)^2,
\]
называется выборочной дисперсией.
Используя тождество \(\sum_{i=1}^n(X_i-\overline X)^2=\sum_{i=1}^n X_i^2-n\overline X^2\), получаем
\[
s_n^2
=
\overline{X^2}
-
\overline X^2.
\]
Cвойства точечных оценок
Оценка \(\widehat{\tau}_n\) называется несмещённой оценкой параметрической функции \(\tau(\theta)\), если
\[
\mathbb E_\theta\widehat{\tau}_n
=
\tau(\theta)
\qquad
\forall\theta\in\Theta.
\]
В частности, \(\widehat\theta_n\) является несмещённой оценкой параметра \(\theta\), если \(\mathbb E_\theta\widehat\theta_n=\theta\).
Смещением оценки \(\widehat{\tau}_n\) называется величина
\[
\operatorname{Bias}_\theta(\widehat{\tau}_n)
=
\mathbb E_\theta\widehat{\tau}_n-\tau(\theta).
\]
Последовательность оценок \(\widehat{\tau}_n\) называется состоятельной оценкой \(\tau(\theta)\), если для любого \(\theta\in\Theta\)
\[
\widehat{\tau}_n
\xrightarrow{\mathbb P_\theta}
\tau(\theta),
\qquad n\to\infty.
\]
Последовательность оценок \(\widehat{\tau}_n\) называется сильно состоятельной, если для любого \(\theta\in\Theta\)
\[
\widehat{\tau}_n
\xrightarrow{\text{п.н.}}
\tau(\theta).
\]
Оценка \(\widehat{\tau}_n\) называется асимптотически нормальной оценкой \(\tau(\theta)\) с асимптотической дисперсией \(\sigma^2(\theta)\), если
\[
\sqrt n
\left(
\widehat{\tau}_n-\tau(\theta)
\right)
\xrightarrow{d_\theta}
N
\left(
0,\sigma^2(\theta)
\right).
\]
Функция \(\sigma^2(\theta)\) называется асимптотической дисперсией оценки.
Наследование свойств
Пусть
\[
\widehat{\theta}_n
\xrightarrow{\mathbb P}
\theta
\]
и функция \(\tau\) непрерывна в точке \(\theta\). Тогда по теореме о непрерывном отображении
\[
\tau(\widehat{\theta}_n)
\xrightarrow{\mathbb P}
\tau(\theta).
\]
Если
\[
\widehat{\theta}_n
\xrightarrow{\text{п.н.}}
\theta
\]
и \(\tau\) непрерывна в точке \(\theta\), то
\[
\tau(\widehat{\theta}_n)
\xrightarrow{\text{п.н.}}
\tau(\theta).
\]
Пусть
\[
\sqrt n
(\widehat{\theta}_n-\theta)
\xrightarrow{d}
N
\left(
0,\sigma^2(\theta)
\right),
\]
а функция \(\tau\) дифференцируема в точке \(\theta\). Тогда по дельта-методу
\[
\sqrt n
\left(
\tau(\widehat{\theta}_n)-\tau(\theta)
\right)
\xrightarrow{d}
N
\left(
0,
\sigma^2(\theta)
[\tau'(\theta)]^2
\right).
\]
Важные результаты
Всегда ли существует несмещённая оценка?
Несмещённость является естественным и желательным свойством оценки. Однако несмещённая оценка заданной параметрической функции существует не всегда.
Рассмотрим простой пример. Пусть
\[
X_1,\ldots,X_n
\overset{\mathrm{i.i.d.}}{\sim}
\operatorname{Bernoulli}(\theta),
\qquad
\theta\in(0,1),
\]
и предположим, что требуется оценить параметрическую функцию
\[
\tau(\theta)=\frac{1}{\theta}.
\]
Можно показать, что несмещённой оценки \(\tau(\theta)\) не существует.
Всегда ли несмещённые оценки полезны?
Даже если несмещённая оценка существует, это ещё не означает, что она обладает хорошими статистическими свойствами.
Рассмотрим следующий пример. Пусть имеется всего одно наблюдение \(X_1\) с распределением
\[
\mathbb P_\theta(X_1=k)
=
\theta^k(1-\theta),
\qquad
k\in\mathbb Z_+,
\qquad
\theta\in(0,1).
\]
Несмещённая оценка имеет вид
\[
\widehat\theta
=
\mathbf 1_{\{X_1\geq1\}}.
\]
Действительно,
\[
\mathbb E_\theta\widehat\theta
=
\mathbb P_\theta(X_1\geq1)
=
1-\mathbb P_\theta(X_1=0)
=
\theta.
\]
Однако несмещённость сама по себе ещё ничего не говорит о точности оценки.
Полезные результаты для решения задач
Пусть \(X\sim U(0,\theta)\).
Тогда для любого \(k>-1\)
\[
\mathbb E X^k
=
\frac{\theta^k}{k+1}.
\]
Минимум и максимум равномерной выборки
Пусть \(X_1,\ldots,X_n\overset{\mathrm{i.i.d.}}{\sim}U(0,\theta)\).
Для \(0\leq x\leq\theta\), выполнено \(\mathbb P_\theta(X_{(n)}\leq x)=\left(\frac{x}{\theta}\right)^n\).
Следовательно,
\[
\frac{X_{(n)}}{\theta}
\sim
\operatorname{Beta}(n,1).
\]
Для минимума выполнено \(\mathbb P_\theta(X_{(1)}>x)=\left(1-\frac{x}{\theta}\right)^n\).
Следовательно,
\[
\frac{X_{(1)}}{\theta}
\sim
\operatorname{Beta}(1,n).
\]
Из свойств бета-распределения следуют формулы
\[
\boxed{
\mathbb E_\theta X_{(1)}
=
\frac{\theta}{n+1},
}
\]
\[
\boxed{
\mathbb E_\theta X_{(n)}
=
\frac{n}{n+1}\theta.
}
\]
Предельное распределение максимума
Рассмотрим
\[
Y_n
=
\frac{n}{\theta}
\left(
\theta-X_{(n)}
\right).
\]
Тогда для \(x\geq0\)
\[
\begin{aligned}
\mathbb P(Y_n>x)
&=
\mathbb P
\left(
X_{(n)}
<
\theta\left(1-\frac{x}{n}\right)
\right)
=
\left(
1-\frac{x}{n}
\right)^n
\longrightarrow
e^{-x}.
\end{aligned}
\]
Следовательно,
\[
\frac{n}{\theta}
\left(
\theta-X_{(n)}
\right)
\xrightarrow{d}
\operatorname{Exp}(1).
\]
Аналогично для минимума
\[
\frac{n}{\theta}X_{(1)}
\xrightarrow{d}
\operatorname{Exp}(1).
\]
Пусть \(X\sim\operatorname{Exp}(\theta)\) в параметризации по интенсивности:
\[
f_\theta(x)
=
\theta e^{-\theta x},
\qquad
x\geq0.
\]
Тогда для любого \(k\in\mathbb N\)
\[
\mathbb EX^k
=
\frac{k!}{\theta^k}.
\]