Seminar 1: Виды сходимостей случайных векторов

Author

Carlos Buitrago

Пусть \(\xi,\xi_1,\xi_2,\ldots\) — случайные векторы со значениями в \(\mathbb R^m\),

\[ \xi_n = \left( \xi_n^{(1)},\ldots,\xi_n^{(m)} \right)^\top, \qquad \xi = \left( \xi^{(1)},\ldots,\xi^{(m)} \right)^\top. \]

NoteСходимость почти наверное

Последовательность случайных векторов \(\{\xi_n\}_{n\geq1}\) называется сходящейся почти наверное к случайному вектору \(\xi\), если

\[ \mathbb P \left( \omega: \lim_{n\to\infty}\xi_n(\omega)=\xi(\omega) \right) = 1. \]

Обозначение:

\[ \xi_n\xrightarrow{\text{п.н.}}\xi. \]

Эквивалентно, для любой нормы \(\|\cdot\|\) на \(\mathbb R^m\),

\[ \mathbb P \left( \lim_{n\to\infty} \|\xi_n-\xi\| = 0 \right) = 1. \]

NoteСходимость по вероятности

Последовательность случайных векторов \(\{\xi_n\}_{n\geq1}\) называется сходящейся по вероятности к случайному вектору \(\xi\), если для любого \(\varepsilon>0\)

\[ \mathbb P \left( \|\xi_n-\xi\|\geq\varepsilon \right) \longrightarrow0, \qquad n\to\infty. \]

Обозначение:

\[ \xi_n\xrightarrow{\mathbb P}\xi. \]

NoteСходимость в \(L^p\)

Пусть \(p\geq 1\). Последовательность случайных векторов \(\{\xi_n\}_{n\geq1}\) называется сходящейся в \(L^p\) к случайному вектору \(\xi\), если

\[ \mathbb E \|\xi_n-\xi\|^p \longrightarrow0, \qquad n\to\infty. \]

Обозначение:

\[ \xi_n\xrightarrow{L^p}\xi. \]

NoteСходимость по распределению

Последовательность случайных векторов \(\{\xi_n\}_{n\geq1}\) называется сходящейся по распределению к случайному вектору \(\xi\), если для любой ограниченной непрерывной функции \(f:\mathbb R^m\to\mathbb R\), выполнено

\[ \mathbb E f(\xi_n) \longrightarrow \mathbb E f(\xi). \]

Обозначение:

\[ \xi_n\xrightarrow{d}\xi. \]

Сходимость по распределению является свойством распределений случайных векторов. В отличие от сходимости почти наверное, по вероятности или в \(L^p\), случайные векторы \(\xi_n\) и \(\xi\) не обязаны быть определены на одном и том же вероятностном пространстве.

WarningТеорема Александрова для случайных векторов

Сходимость по распределению \(\xi_n \xrightarrow{d} \xi\) имеет место тогда и только тогда, когда

\[ F_{\xi_n}(x) \longrightarrow F_\xi(x) \]

для любой точки \(x \in \mathbb{R}^m\), в которой функция распределения \(F_\xi\) непрерывна.

WarningТеорема: Связь между типами сходимости

Для случайных векторов справедливы импликации

\[ \boxed{ \begin{array}{c} \xi_n \xrightarrow{\text{п.н.}} \xi \\[8pt] \xi_n \xrightarrow{L^p} \xi \end{array} \quad \Longrightarrow \quad \xi_n \xrightarrow{\mathbb P} \xi \quad \Longrightarrow \quad \xi_n \xrightarrow{d} \xi } \] Обратные импликации в общем случае неверны.

В асимптотической статистике удобно использовать вероятностные аналоги классических обозначений \(o(\cdot)\) и \(O(\cdot)\).

Говорят, что \(X_n=o_{\mathbb P}(1)\), если

\[ X_n\xrightarrow{\mathbb P}0. \]

Более общо, \(X_n=o_{\mathbb P}(a_n)\), если

\[ \frac{X_n}{a_n}\xrightarrow{\mathbb P}0. \]

Последовательность случайных величин \(\{X_n\}\) называется ограниченной по вероятности, и пишут \(X_n=O_{\mathbb P}(1)\), если для любого \(\varepsilon>0\) существует \(M>0\) такое, что

\[ \limsup_{n\to\infty} \mathbb P(|X_n|>M) \leq \varepsilon. \]

Более общо, \(X_n=O_{\mathbb P}(a_n)\), если

\[ \frac{X_n}{a_n}=O_{\mathbb P}(1). \]

Например, если \(\sqrt n(T_n-\theta)\xrightarrow{d}Z\), то

\[T_n-\theta=O_{\mathbb P}(n^{-1/2}).\]

0.1 Связь с разложением Тейлора

Пусть

\[ T_n-\theta=O_{\mathbb P}(n^{-1/2}). \]

Если функция \(h\) дважды дифференцируема в окрестности \(\theta\), то

\[ h(T_n) = h(\theta) + h'(\theta)(T_n-\theta) + O_{\mathbb P}\left((T_n-\theta)^2\right). \]

Поскольку

\[ (T_n-\theta)^2 = O_{\mathbb P}(n^{-1}), \]

получаем

\[ h(T_n) = h(\theta) + h'(\theta)(T_n-\theta) + O_{\mathbb P}(n^{-1}). \]

Именно такая запись часто используется в асимптотической теории статистических оценок.

WarningТеорема: Сходимость случайного вектора и его компонент

Пусть

\[ \xi_n = \left( \xi_n^{(1)},\ldots,\xi_n^{(m)} \right)^\top, \qquad \xi = \left( \xi^{(1)},\ldots,\xi^{(m)} \right)^\top. \]

Тогда справедливо

\[ \xi_n\xrightarrow{\text{п.н.}}\xi \quad\Longleftrightarrow\quad \xi_n^{(j)} \xrightarrow{\text{п.н.}} \xi^{(j)} \quad \forall j=1,\ldots,m. \]

\[ \xi_n\xrightarrow{\mathbb P}\xi \quad\Longleftrightarrow\quad \xi_n^{(j)} \xrightarrow{\mathbb P} \xi^{(j)} \quad \forall j=1,\ldots,m. \]

\[ \xi_n\xrightarrow{L^p}\xi \quad\Longleftrightarrow\quad \xi_n^{(j)} \xrightarrow{L^p} \xi^{(j)} \quad \forall j=1,\ldots,m. \]

TipЗамечание о сходимости по распределению

Для сходимости по распределению покоординатная сходимость уже недостаточна. То есть

\[\xi_n\xrightarrow{d}\xi \Longrightarrow \xi_n^{(j)} \xrightarrow{d} \xi^{(j)}, \qquad j=1,\ldots,m. \]

Однако обратная импликация в общем случае неверна.

Причина состоит в том, что покоординатная сходимость определяет только предельные маргинальные распределения компонент. Она не содержит полной информации о зависимости между компонентами и, следовательно, не определяет совместное предельное распределение.

WarningТеорема: Критерий Крамера–Уолда

Пусть \(\xi_n,\xi\) — случайные векторы в \(\mathbb R^m\). Тогда

\[ \xi_n\xrightarrow{d}\xi \]

тогда и только тогда, когда для любого \(t\in\mathbb R^m\)

\[ t^\top\xi_n \xrightarrow{d} t^\top\xi. \]

Критерий Крамера–Уолда показывает, что многомерная слабая сходимость полностью определяется поведением всех одномерных линейных проекций

\[ t^\top\xi_n. \]

Этот результат является одним из основных инструментов доказательства многомерной центральной предельной теоремы.

Warningтеорема о наследовании сходимости

Пусть

\[ h:\mathbb R^m\to\mathbb R^s \]

непрерывна почти всюду относительно распределения \(\xi\).

Тогда

\[ \xi_n\xrightarrow{\text{п.н.}}\xi \Longrightarrow h(\xi_n) \xrightarrow{\text{п.н.}} h(\xi), \]

\[ \xi_n\xrightarrow{\mathbb P}\xi \Longrightarrow h(\xi_n) \xrightarrow{\mathbb P} h(\xi), \]

\[ \xi_n\xrightarrow{\text{d}}\xi \Longrightarrow h(\xi_n) \xrightarrow{\text{d}} h(\xi). \]

TipЛемма Слуцкого

Пусть

\[ \xi_n\xrightarrow{d}\xi, \qquad \eta_n\xrightarrow{d}c, \]

где \(c\) — детерминированная константа. Тогда

\[ (\xi_n,\eta_n) \xrightarrow{d} (\xi,c). \]

1 Дельта-метод

TipОдномерный случай

Пусть

\[ \xi_n \xrightarrow{d} \xi, \qquad b_n \to 0, \qquad b_n \neq 0, \]

и пусть \(h:\mathbb R\to\mathbb R\) — функция, дифференцируемая в точке \(a\in\mathbb R\).

Тогда

\[ \boxed{ \frac{h(a+\xi_n b_n)-h(a)}{b_n} \xrightarrow{d} \xi h'(a). } \]

В частности, если \(\sqrt n(T_n-\theta)\xrightarrow{d}N(0,\sigma^2)\),то

\[\sqrt n\left(h(T_n)-h(\theta)\right)\xrightarrow{d}N\left(0,[h'(\theta)]^2\sigma^2\right).\]

TipМногомерный случай

Пусть \(\xi_n \xrightarrow{d} \xi\), где \(\xi_n,\xi\) — случайные векторы размерности \(m\), и пусть

\[ h:\mathbb R^m\to\mathbb R \]

— функция, дифференцируемая в точке \(a\in\mathbb R^m\). Пусть также

\[ b_n\to0, \qquad b_n\neq0. \]

Тогда

\[ \boxed{ \frac{h(a+\xi_n b_n)-h(a)}{b_n} \xrightarrow{d} \left\langle \xi,\nabla h(a)\right\rangle. } \]

В частности, если \(\sqrt n (T_n-\theta) \xrightarrow{d} N_m(0,\Sigma)\), то

\[ \sqrt n \left( h(T_n)-h(\theta) \right) \xrightarrow{d} N \left( 0, \nabla h(\theta)^\top \Sigma \nabla h(\theta) \right). \]

TipДельта-метод второго порядка: одномерный случай

Пусть

\[ \xi_n \xrightarrow{d} \xi, \qquad b_n \to 0, \qquad b_n \neq 0, \]

и пусть \(h:\mathbb R\to\mathbb R\) — функция, дважды дифференцируемая в точке \(a\in\mathbb R\).

Предположим, что \(h'(a)=0\). Тогда

\[ \boxed{ \frac{h(a+\xi_n b_n)-h(a)}{b_n^2} \xrightarrow{d} \frac{1}{2}\xi^2 h''(a). } \]

2 Предельные Теоремы

WarningМногомерный УЗБЧ

Пусть \(X_1,X_2,\ldots\) — независимые одинаково распределенные случайные векторы в \(\mathbb R^m\) такие, что \(\mathbb E\|X_1\|<\infty\). Тогда

\[ \frac1n \sum_{i=1}^nX_i \xrightarrow{\text{п.н.}} \mathbb EX_1. \]

Доказательство следует непосредственно из одномерного усиленного закона больших чисел, примененного к каждой компоненте:

\[ \frac1n \sum_{i=1}^n X_i^{(j)} \xrightarrow{\text{п.н.}} \mathbb EX_1^{(j)}, \qquad j=1,\ldots,m. \]

После этого используется эквивалентность покоординатной и векторной сходимости почти наверное.

WarningМногомерная ЦПТ

Пусть \(X_1,X_2,\ldots\) — независимые одинаково распределенные случайные векторы в \(\mathbb R^m\) такие, что \(\mathbb EX_1=\mu\) и \(\operatorname{Cov}(X_1)=\Sigma\), где все вторые моменты конечны. Тогда

\[ \frac1{\sqrt n} \sum_{i=1}^n (X_i-\mu) \xrightarrow{d} N_m(0,\Sigma). \]

Если ковариационная матрица \(\Sigma\) положительно определена, то существует матрица \(\Sigma^{-1/2}\). Из многомерной ЦПТ следует

\[ \sqrt n\, \Sigma^{-1/2} (\overline X_n-\mu) \xrightarrow{d} N_m(0,I_m). \]

2.1 Пример: многомерная ЦПТ

Рассмотрим случайный вектор \(X=(X_1,X_2)^\top\) с независимыми компонентами

\[ X_1\sim\operatorname{Exp}(1), \qquad X_2\sim\operatorname{Exp}(1). \]

Тогда распределение \(X\) существенно не является нормальным.

Однако многомерная ЦПТ утверждает, что

\[ \sqrt n \left( \overline X_n-\mathbb EX \right) \xrightarrow{d} N_2(0,I_2). \]

Посмотрим, как меняется форма распределения при росте \(n\).

Show Python code
import numpy as np
import matplotlib.pyplot as plt

rng = np.random.default_rng(42)

n_values = [1, 5, 20, 100]
n_rep = 4000

fig, axes = plt.subplots(1, 4, figsize=(18, 4))

for ax, n in zip(axes, n_values):
    samples = rng.exponential(
        scale=1.0,
        size=(n_rep, n, 2)
    )

    sample_means = samples.mean(axis=1)

    Z = np.sqrt(n) * (sample_means - np.array([1.0, 1.0]))

    ax.scatter(
        Z[:, 0],
        Z[:, 1],
        s=6,
        alpha=0.25
    )

    ax.set_title(f"$n={n}$")
    ax.set_xlabel("$Z_1$")
    ax.set_ylabel("$Z_2$")
    ax.set_xlim(-4, 6)
    ax.set_ylim(-4, 6)
    ax.set_aspect("equal")

plt.tight_layout()
plt.show()