Линейная регрессия: свойства МНК, инференция и ограничения

1 Зачем возвращаться к линейной регрессии?

Базовая линейная регрессия уже знакома нам из математической статистики. Здесь нас будут интересовать вопросы, которые возникают после стандартной формулы МНК:

  • Что именно измеряет \(R^2\) и почему при добавлении регрессоров он почти всегда растёт?
  • Какие свойства МНК требуют нормальности ошибок, а какие — нет?
  • Что остаётся верным, если отказаться от нормальности?
  • Когда МНК является BLUE?
  • Как оценивать неизвестную дисперсию ошибки?
  • Как строить точные и асимптотические тесты?
  • Как одновременно тестировать несколько коэффициентов?
  • Что делать, если о параметрах заранее известны дополнительные ограничения?

Рассматриваем модель

\[ Y=X\beta+\varepsilon, \]

где \(Y\in\mathbb R^n\), \(X\in\mathbb R^{n\times k}\), \(\beta\in\mathbb R^k\).

2 Что мы уже знаем о нормальной линейной модели

До этого момента мы в основном работали с гауссовской линейной моделью

\[ Y = X\theta + \varepsilon, \qquad \varepsilon \sim \mathcal N(0,\sigma^2 I_n), \]

где

\[ Y\in\mathbb R^n, \qquad X\in\mathbb R^{n\times k}, \qquad \theta\in\mathbb R^k. \]

При фиксированной матрице регрессоров \(X\) это эквивалентно

\[ Y\mid X \sim \mathcal N(X\theta,\sigma^2 I_n). \]

В этой модели нам уже известны основные конечновыборочные свойства МНК-оценок и классические процедуры статистического вывода.

Ниже кратко соберём эти результаты, чтобы затем понять, что из них сохранится, если отказаться от предположения о нормальности ошибок.

2.1 МНК в гауссовской линейной модели

TipЧто нам уже известно об оценивании \(\theta\) и \(\sigma^2\)?

При условии

\[ \operatorname{rank}(X)=k \]

МНК-оценка параметра \(\theta\) имеет вид

\[ \boxed{ \hat\theta = (X^\top X)^{-1}X^\top Y. } \]

Предсказанные значения:

\[ \hat Y=X\hat\theta. \]

Остатки равны

\[ \hat\varepsilon = Y-X\hat\theta, \]

а остаточная сумма квадратов

\[ SSR = \|\hat\varepsilon\|^2 = \|Y-X\hat\theta\|^2. \]

Несмещённая оценка дисперсии ошибки:

\[ \boxed{ \hat\sigma^2 = \frac{1}{n-k} \|Y-X\hat\theta\|^2 = \frac{SSR}{n-k}. } \]

Здесь \(n-k\) — число остаточных степеней свободы.

2.2 Точное распределение МНК-оценки

TipКак распределена \(\hat\theta\) при нормальных ошибках?

Имеем

\[ \hat\theta = (X^\top X)^{-1}X^\top Y. \]

Подставляя

\[ Y=X\theta+\varepsilon, \]

получаем

\[ \hat\theta = \theta + (X^\top X)^{-1}X^\top\varepsilon. \]

Поскольку \(\hat\theta\) является линейным преобразованием нормального вектора \(\varepsilon\),

\[ \boxed{ \hat\theta\mid X \sim \mathcal N \left( \theta,\, \sigma^2(X^\top X)^{-1} \right). } \]

В частности,

\[ E(\hat\theta\mid X)=\theta, \]

то есть МНК-оценка несмещённа, и

\[ \operatorname{Var}(\hat\theta\mid X) = \sigma^2(X^\top X)^{-1}. \]

Для отдельного коэффициента:

\[ \boxed{ \hat\theta_j\mid X \sim \mathcal N \left( \theta_j,\, \sigma^2[(X^\top X)^{-1}]_{jj} \right). } \]

Это точный конечновыборочный результат: здесь не требуется переход \(n\to\infty\).

2.3 Распределение оценки дисперсии и независимость

TipЧто мы знаем о \(\hat\sigma^2\) и её связи с \(\hat\theta\)?

Из ортогонального разложения гауссовского вектора следует

\[ \boxed{ \frac{(n-k)\hat\sigma^2}{\sigma^2} = \frac{\|Y-X\hat\theta\|^2}{\sigma^2} = \frac{SSR}{\sigma^2} \sim \chi^2_{n-k}. } \]

Кроме того,

\[ \boxed{ \hat\theta \perp\!\!\!\perp \hat\sigma^2 \mid X. } \]

Таким образом, при нормальности ошибок мы знаем не только точное распределение \(\hat\theta\), но и точное распределение остаточной суммы квадратов, причём эти две случайные величины условно независимы при фиксированном \(X\).

Именно эти свойства лежат в основе точных \(t\)- и \(F\)-тестов.

2.4 Проверка линейных гипотез

TipКак мы до сих пор проверяли несколько линейных ограничений на параметры?

Пусть требуется проверить гипотезу

\[ H_0:T\theta=\tau, \]

где

\[ T\in\mathbb R^{m\times k}, \qquad \operatorname{rank}(T)=m. \]

Из

\[ \hat\theta\mid X \sim \mathcal N \left( \theta,\, \sigma^2(X^\top X)^{-1} \right) \]

следует

\[ T\hat\theta\mid X \sim \mathcal N \left( T\theta,\, \sigma^2T(X^\top X)^{-1}T^\top \right). \]

Обозначим

\[ B = T(X^\top X)^{-1}T^\top. \]

При выполнении \(H_0\) имеем

\[ T\theta=\tau, \]

поэтому

\[ T\hat\theta-\tau \sim \mathcal N(0,\sigma^2B). \]

Следовательно, квадратичная форма

\[ \boxed{ \frac{ (T\hat\theta-\tau)^\top B^{-1} (T\hat\theta-\tau) }{ \sigma^2 } \sim \chi^2_m. } \]

2.5 Классический \(F\)-тест

TipЧто делать, если \(\sigma^2\) неизвестна?

На практике параметр \(\sigma^2\) обычно неизвестен.

Мы уже знаем, что

\[ \hat\sigma^2 = \frac{\|Y-X\hat\theta\|^2}{n-k} \]

является несмещённой оценкой \(\sigma^2\), причём при нормальных ошибках

\[ \frac{(n-k)\hat\sigma^2}{\sigma^2} \sim \chi^2_{n-k}, \]

и \(\hat\sigma^2\) независима от \(\hat\theta\).

Поэтому для проверки

\[ H_0:T\theta=\tau \]

получаем статистику

\[ \boxed{ F = \frac{ (T\hat\theta-\tau)^\top \left[ T(X^\top X)^{-1}T^\top \right]^{-1} (T\hat\theta-\tau) }{ m\hat\sigma^2 } \sim F_{m,n-k}. } \]

Эквивалентно,

\[ F = \frac{ (T\hat\theta-\tau)^\top B^{-1} (T\hat\theta-\tau) }{ \|Y-X\hat\theta\|^2 } \frac{n-k}{m}. \]

Таким образом, в гауссовской линейной модели мы получаем точный \(F\)-тест при любом конечном \(n\).

3 Что теперь хотим понять?

До этого момента мы получили очень сильные результаты для модели

\[ Y=X\theta+\varepsilon \]

при предположении

\[ \boxed{ \varepsilon\mid X \sim \mathcal N(0,\sigma^2I_n). } \]

В частности, мы знаем точные распределения

\[ \hat\theta\mid X \sim \mathcal N \left( \theta,\sigma^2(X^\top X)^{-1} \right), \]

\[ \frac{(n-k)\hat\sigma^2}{\sigma^2} \sim \chi^2_{n-k}, \]

а также независимость

\[ \hat\theta \perp\!\!\!\perp \hat\sigma^2 \mid X. \]

Благодаря этому мы можем строить точные \(t\)- и \(F\)-тесты.

Однако предположение о нормальности ошибок является достаточно сильным.

Поэтому теперь естественно задать следующие вопросы:

  1. Что останется верным, если ошибки не являются нормальными?

  2. Будет ли МНК-оценка

\[ \hat\theta=(X^\top X)^{-1}X^\top Y \]

по-прежнему несмещённой?

  1. Будет ли она по-прежнему оптимальной среди других оценок?

  2. Если точная нормальность \(\hat\theta\) исчезает, будет ли \(\hat\theta\) хотя бы асимптотически нормальной при \(n\to\infty\)?

  3. Можно ли без нормальности по-прежнему строить тесты гипотез о компонентах \(\theta\)?

  4. Какие предположения действительно нужны для:

    • несмещённости;
    • состоятельности;
    • эффективности;
    • асимптотической нормальности;
    • статистического тестирования?
  5. Наконец, что изменится, если у нас имеется дополнительная априорная информация о параметрах, например

\[ R\theta=r? \]

Можно ли использовать эту информацию, чтобы получить более точную оценку, чем обычная МНК-оценка?

Таким образом, далее наша задача состоит в том, чтобы понять, какие свойства МНК являются следствием самой линейной структуры модели, а какие зависят от дополнительных предположений об ошибках.

4 1. Геометрия оценённой линейной модели

TipВопрос

На какие две части МНК разбивает наблюдаемый вектор \(Y\) и почему это разложение полезно?

МНК-оценка:

\[ \hat\beta=(X^\top X)^{-1}X^\top Y. \]

Предсказанные значения равны

\[ \hat Y=X\hat\beta =X(X^\top X)^{-1}X^\top Y =P_XY, \]

где

\[ P_X=X(X^\top X)^{-1}X^\top \]

— матрица ортогональной проекции на пространство столбцов \(X\).

Остатки:

\[ \hat\varepsilon=Y-\hat Y=(I-P_X)Y. \]

Следовательно,

\[ \boxed{Y=\hat Y+\hat\varepsilon.} \]

При этом

\[ X^\top\hat\varepsilon=0, \]

то есть остатки ортогональны каждому столбцу матрицы регрессоров.

4.1 1.1. Разложение вариации

TipВопрос

Как количественно разделить общую вариацию \(Y\) на объяснённую моделью и оставшуюся в остатках?

Если модель содержит константу, то

\[ \sum_{i=1}^n\hat\varepsilon_i=0, \qquad \overline{\hat Y}=\bar Y. \]

Определим

\[ SST=\sum_{i=1}^n(Y_i-\bar Y)^2, \]

\[ SSE=\sum_{i=1}^n(\hat Y_i-\bar Y)^2, \]

\[ SSR=\sum_{i=1}^n(Y_i-\hat Y_i)^2 =\sum_{i=1}^n\hat\varepsilon_i^2. \]

Из ортогональности объяснённой и остаточной частей следует

\[ \boxed{SST=SSE+SSR.} \]

Замечание о обозначениях. В литературе обозначения SSE и SSR иногда меняются местами. Здесь используем: \(SSE\) = explained, \(SSR\) = residual.

5 2. Коэффициент детерминации

TipВопрос

Какую долю вариации \(Y\) объясняет линейная модель?

Для модели с константой

\[ \boxed{ R^2=\frac{SSE}{SST} =1-\frac{SSR}{SST}. } \]

Поэтому \(R^2\) близкое к единице означает, что остаточная вариация мала относительно общей вариации.

5.1 2.1. Связь \(R^2\) с корреляцией

TipВопрос

Можно ли интерпретировать \(R^2\) непосредственно через корреляцию?

Для множественной регрессии с константой

\[ \boxed{ R^2=\widehat{\operatorname{corr}}^{\,2}(\hat Y,Y). } \]

Для парной регрессии

\[ Y_i=\beta_0+\beta_1X_i+\varepsilon_i \]

дополнительно выполняется

\[ \boxed{ R^2=\widehat{\operatorname{corr}}^{\,2}(X,Y). } \]

Последнее равенство является специальным свойством парной регрессии с константой.

5.2 2.2. Почему обычный \(R^2\) опасен при сравнении моделей?

TipВопрос

Если новый регрессор почти бесполезен, может ли добавление его в модель ухудшить \(R^2\)?

Нет. При добавлении новых столбцов в \(X\) множество допустимых линейных предсказаний только расширяется. Поэтому минимальный \(SSR\) не может увеличиться:

\[ SSR_{\text{new}}\le SSR_{\text{old}}. \]

Следовательно,

\[ R^2_{\text{new}}\ge R^2_{\text{old}}. \]

Это происходит даже тогда, когда дополнительная переменная почти ничего не объясняет.

5.3 2.3. Скорректированный \(R^2\)

TipВопрос

Как сравнивать модели с разным числом регрессоров, штрафуя модель за лишние параметры?

Пусть \(k\) — число оцениваемых коэффициентов включая константу. Тогда

\[ \boxed{ R^2_{\mathrm{adj}} = 1-(1-R^2)\frac{n-1}{n-k}. } \]

В отличие от обычного \(R^2\), скорректированный коэффициент может уменьшиться после добавления нового регрессора.

Он сравнивает улучшение подгонки с потерей степеней свободы.

6 3. Какие предположения нам действительно нужны?

Рассмотрим стандартные условия.

GM1. Линейность по параметрам

\[ Y_i=X_i^\top\beta+\varepsilon_i. \]

GM2. Случайная выборка

\[ \{(Y_i,X_i)\}_{i=1}^n \quad\text{н.о.р.} \]

GM3. Отсутствие полной мультиколлинеарности

Матрица \(X\) имеет полный столбцовый ранг.

GM4. Нулевое условное среднее

\[ \boxed{ E(\varepsilon_i\mid X_i)=0. } \]

GM5. Гомоскедастичность

\[ \boxed{ \operatorname{Var}(\varepsilon_i\mid X_i)=\sigma^2. } \]

6.1 3.1. Условное и безусловное нулевое среднее

TipВопрос

Чем \(E(\varepsilon)=0\) отличается от гораздо более сильного условия \(E(\varepsilon\mid X)=0\)?

Условие

\[ E(\varepsilon)=0 \]

говорит только, что ошибки компенсируются в среднем по всей популяции.

Условие

\[ E(\varepsilon\mid X)=0 \]

говорит, что ошибки имеют среднее ноль при каждом фиксированном значении регрессоров.

Например, при прогнозировании цены квартиры по площади:

  • \(E(\varepsilon)=0\) допускает, что модель систематически завышает цены маленьких квартир и занижает цены больших, если эти ошибки в среднем компенсируются;
  • \(E(\varepsilon\mid X)=0\) требует отсутствия такой систематической ошибки при каждой площади \(X\).

По закону повторного ожидания

\[ E(\varepsilon\mid X)=0 \quad\Longrightarrow\quad E(\varepsilon)=0. \]

Более того,

\[ E(\varepsilon\mid X)=0 \quad\Longrightarrow\quad E(X^\top\varepsilon)=0. \]

Последнее — условие ортогональности регрессоров и ошибки.

7 4. Теорема Гаусса—Маркова

TipВопрос

Если ошибки не обязаны быть нормальными, остаётся ли МНК в каком-либо смысле оптимальным?

Да. Нормальность не нужна для теоремы Гаусса—Маркова.

При выполнении условий линейности, полного ранга, нулевого условного среднего и

\[ \operatorname{Var}(\varepsilon\mid X)=\sigma^2I_n, \]

МНК является BLUE — best linear unbiased estimator:

\[ \boxed{ \hat\beta \text{ имеет минимальную дисперсию в классе линейных несмещённых оценок.} } \]

7.1 4.1. Что означает «линейная оценка»?

Любую линейную по \(Y\) оценку можно записать как

\[ \tilde\beta=A^\top Y, \qquad A\in\mathbb R^{n\times k}. \]

Условие несмещённости:

\[ E(\tilde\beta\mid X) =A^\top X\beta=\beta \]

для всех \(\beta\). Следовательно,

\[ \boxed{A^\top X=I_k.} \]

МНК также принадлежит этому классу:

\[ \hat\beta = (X^\top X)^{-1}X^\top Y. \]

Для любого \(c\in\mathbb R^k\) теорема утверждает

\[ \boxed{ \operatorname{Var}(c^\top\hat\beta\mid X) \le \operatorname{Var}(c^\top\tilde\beta\mid X). } \]

Эквивалентно,

\[ \operatorname{Var}(\tilde\beta\mid X) - \operatorname{Var}(\hat\beta\mid X) \succeq0. \]

8 5. Оценивание дисперсии ошибки

TipВопрос

Если \(\sigma^2\) неизвестна, как оценить уровень шума по остаткам и почему нельзя просто делить на \(n\)?

При

\[ E(\varepsilon\mid X)=0, \qquad \operatorname{Var}(\varepsilon\mid X)=\sigma^2I_n, \]

несмещённая оценка имеет вид

\[ \boxed{ \hat\sigma^2 = \frac{SSR}{n-k}, } \]

где \(k\) — число оцениваемых коэффициентов.

Потеря \(k\) степеней свободы возникает потому, что остатки получены после оценивания \(k\) параметров.

Если же мы максимизируем нормальную функцию правдоподобия, MLE равна

\[ \hat\sigma^2_{\mathrm{MLE}}=\frac{SSR}{n}, \]

но эта оценка в конечной выборке смещена.

9 6. Что даёт предположение о нормальности?

TipВопрос

Какие дополнительные результаты появляются, если предположить точную нормальность ошибок?

Предположим

\[ \boxed{ \varepsilon\mid X\sim \mathcal N(0,\sigma^2I_n). } \]

Так как

\[ \hat\beta = \beta+(X^\top X)^{-1}X^\top\varepsilon, \]

МНК является линейным преобразованием нормального вектора. Поэтому

\[ \boxed{ \hat\beta\mid X \sim \mathcal N\left( \beta,\, \sigma^2(X^\top X)^{-1} \right). } \]

В частности,

\[ \boxed{ \hat\beta_j\mid X \sim \mathcal N\left( \beta_j,\, \sigma^2[(X^\top X)^{-1}]_{jj} \right). } \]

Это точное конечновыборочное распределение, а не асимптотическое утверждение.

10 7. Лемма Фишера и точный \(t\)-тест

TipВопрос

Если \(\sigma^2\) неизвестна, почему после её замены на оценку возникает распределение Стьюдента?

При нормальных ошибках:

\[ \boxed{ \frac{(n-k)\hat\sigma^2}{\sigma^2} = \frac{SSR}{\sigma^2} \sim\chi^2_{n-k}, } \]

и

\[ \boxed{ \hat\beta\ \perp\!\!\!\perp\ \hat\sigma^2 \mid X. } \]

Для проверки

\[ H_0:\beta_j=\beta_{j0} \]

при известной \(\sigma^2\):

\[ Z_j = \frac{ \hat\beta_j-\beta_{j0} }{ \sqrt{\sigma^2[(X^\top X)^{-1}]_{jj}} } \sim\mathcal N(0,1). \]

После замены \(\sigma^2\) на \(\hat\sigma^2\) получаем

\[ \boxed{ t_j = \frac{ \hat\beta_j-\beta_{j0} }{ \sqrt{\hat\sigma^2[(X^\top X)^{-1}]_{jj}} } = \frac{\hat\beta_j-\beta_{j0}} {\operatorname{se}(\hat\beta_j)} \sim t_{n-k}. } \]

Здесь распределение \(t\) является точным, поскольку используется нормальность ошибок.

11 8. Одновременная проверка нескольких коэффициентов: \(F\)-тест

TipВопрос

Как проверить сразу несколько линейных ограничений, а не один коэффициент?

Рассмотрим полную модель

\[ Y=X\beta+Z\gamma+\varepsilon, \qquad \varepsilon\mid X,Z\sim\mathcal N(0,\sigma^2I_n), \]

и гипотезу

\[ H_0:\beta=0. \]

Пусть:

  • \(X\) содержит \(q\) коэффициентов, которые тестируются;
  • \(Z\) содержит остальные регрессоры;
  • \(SSR_U\) — сумма квадратов остатков полной (unrestricted) модели;
  • \(SSR_R\) — сумма квадратов остатков модели под \(H_0\).

Тогда

\[ \boxed{ F= \frac{(SSR_R-SSR_U)/q} {SSR_U/(n-k_U)} } \]

при \(H_0\) имеет распределение

\[ \boxed{ F\sim F_{q,n-k_U}, } \]

где \(k_U\) — число параметров полной модели.

Числитель измеряет потерю качества подгонки из-за наложения ограничений, а знаменатель — оценённый уровень шума.

12 9. Что остаётся без нормальности?

TipВопрос

Если ошибки не нормальны, теряем ли мы возможность делать статистический вывод о \(\beta\)?

Нет. При стандартных регулярных условиях МНК остаётся состоятельным и асимптотически нормальным.

Из

\[ \hat\beta-\beta = (X^\top X)^{-1}X^\top\varepsilon \]

получаем

\[ \boxed{ \sqrt n(\hat\beta-\beta) = \left(\frac{X^\top X}{n}\right)^{-1} \left(\frac{X^\top\varepsilon}{\sqrt n}\right). } \]

Первый множитель обычно исследуется с помощью закона больших чисел, второй — с помощью ЦПТ.

При подходящих условиях

\[ \boxed{ \sqrt n(\hat\beta-\beta) \xrightarrow{d} \mathcal N(0,V). } \]

Таким образом, нормальность ошибок нужна для точной конечновыборочной инференции, но не для асимптотической нормальности МНК.

12.1 9.1. Несмещённость, состоятельность и асимптотическая нормальность

TipВопрос

Какие свойства МНК требуют нулевого условного среднего, а какие могут выполняться при более слабых условиях?

Условие

\[ E(\varepsilon\mid X)=0 \]

обеспечивает несмещённость МНК при стандартной постановке:

\[ E(\hat\beta\mid X)=\beta. \]

Для состоятельности часто достаточно более слабого условия ортогональности:

\[ E(X_i\varepsilon_i)=0, \]

вместе с условиями, гарантирующими закон больших чисел и невырожденность

\[ E(X_iX_i^\top). \]

Важно различать:

\[ E(X_i\varepsilon_i)=0 \]

— ортогональность, тогда как

\[ \operatorname{Cov}(X_i,\varepsilon_i)=0 \]

— некоррелированность. Они совпадают, например, если \(E(\varepsilon_i)=0\).

13 10. Асимптотический \(t\)-тест

TipВопрос

Как тестировать \(H_0:\beta_j=\beta_{j0}\) без предположения о нормальности ошибок?

Из асимптотической нормальности после корректной стандартизации следует

\[ \boxed{ t = \frac{\hat\beta_j-\beta_{j0}} {\widehat{\operatorname{se}}(\hat\beta_j)} \xrightarrow{d}\mathcal N(0,1). } \]

В гомоскедастическом случае

\[ \widehat{\operatorname{Var}}(\hat\beta\mid X) = \hat\sigma^2(X^\top X)^{-1}. \]

Ключевое отличие от предыдущего раздела:

  • при нормальных ошибках \(t\)-распределение является точным;
  • без нормальности нормальная аппроксимация является асимптотической.

14 11. Дополнительная информация о параметрах: ограниченный МНК

TipВопрос

Что делать, если мы заранее точно знаем, что истинные коэффициенты удовлетворяют некоторым линейным ограничениям? Можно ли использовать эту информацию для более точного оценивания?

Пусть известно

\[ \boxed{R\beta=r}, \]

где \(R\in\mathbb R^{q\times k}\) имеет ранг \(q\).

Вместо безусловной минимизации \(SSR\) решаем

\[ \min_\beta (Y-X\beta)^\top(Y-X\beta) \quad \text{при условии} \quad R\beta=r. \]

Лагранжиан:

\[ \boxed{ \mathcal L(\beta,\lambda) = (Y-X\beta)^\top(Y-X\beta) + 2\lambda^\top(R\beta-r). } \]

Условия первого порядка:

\[ -2X^\top(Y-X\hat\beta_R)+2R^\top\lambda_R=0, \]

\[ R\hat\beta_R=r. \]

Решая эту систему, получаем

\[ \boxed{ \hat\beta_R = \hat\beta - (X^\top X)^{-1}R^\top \left[ R(X^\top X)^{-1}R^\top \right]^{-1} (R\hat\beta-r). } \]

14.1 11.1. Почему ограниченная оценка может быть лучше?

Если ограничение \(R\beta=r\) действительно верно, мы исключаем направления параметрического пространства, которые заведомо невозможны.

Обычный МНК может из-за выборочного шума дать

\[ R\hat\beta\ne r. \]

Ограниченный МНК корректирует \(\hat\beta\) ровно настолько, чтобы

\[ R\hat\beta_R=r. \]

При корректных ограничениях дисперсия уменьшается:

\[ \boxed{ \operatorname{Var}(\hat\beta_R\mid X) \preceq \operatorname{Var}(\hat\beta\mid X). } \]

Но если ограничение ошибочно, выигрыш в дисперсии покупается ценой смещения. Поэтому известное ограничение и гипотеза, которую ещё нужно проверить, — принципиально разные ситуации.

15 12. Три подхода к проверке ограничений

Пусть

\[ H_0:g(\beta)=0 \]

задаёт \(q\) ограничений.

TipВопрос

Как можно измерить несовместимость данных с ограничением \(H_0\)?

Существуют три классических ответа:

Тест Основная идея
Wald Насколько неограниченная оценка \(\hat\beta\) далека от множества \(H_0\)?
LR Насколько ухудшается максимальное правдоподобие, если навязать \(H_0\)?
LM / Score Если оценить модель только под \(H_0\), насколько сильно функция правдоподобия хочет двигаться прочь от ограничения?

При стандартных регулярных условиях все три статистики асимптотически имеют распределение

\[ \chi_q^2. \]

16 13. LR-тест

TipВопрос

Насколько сильно ограничение ухудшает качество подгонки модели?

При нормальных ошибках профильная логарифмическая функция правдоподобия имеет вид

\[ \ell_n(\beta) = -\frac n2\log SSR(\beta)+\mathrm{const}. \]

Поэтому

\[ \boxed{ LR = 2\left[ \ell_n(\hat\beta)-\ell_n(\hat\beta_R) \right] = n\log \frac{SSR(\hat\beta_R)} {SSR(\hat\beta)}. } \]

Если \(H_0\) почти не ограничивает модель, то

\[ SSR(\hat\beta_R)\approx SSR(\hat\beta), \]

и \(LR\) мал.

Если ограничение сильно ухудшает подгонку, \(LR\) велик.

16.1 13.1. Локальная форма LR

Используем

\[ \log(1+z)=z+o(z), \]

где

\[ z= \frac{ SSR(\hat\beta_R)-SSR(\hat\beta) }{ SSR(\hat\beta) }. \]

При \(H_0\):

\[ \boxed{ LR = n \frac{ SSR(\hat\beta_R)-SSR(\hat\beta) }{ SSR(\hat\beta) } +o_p(1). } \]

Кроме того, поскольку \(SSR(\beta)\) — квадратичная функция,

\[ \boxed{ SSR(\beta) = SSR(\hat\beta) + (\beta-\hat\beta)^\top X^\top X (\beta-\hat\beta). } \]

В частности,

\[ SSR(\hat\beta_R)-SSR(\hat\beta) = (\hat\beta_R-\hat\beta)^\top X^\top X (\hat\beta_R-\hat\beta). \]

То есть потеря качества подгонки измеряет расстояние между ограниченной и неограниченной оценками в геометрии, задаваемой \(X^\top X\).

17 14. LM / Score-тест

TipВопрос

Можно ли проверить \(H_0\), оценивая только ограниченную модель, не вычисляя неограниченную оценку?

Да. В точке \(\hat\beta_R\) ограниченная модель оптимальна вдоль множества ограничений, но градиент полной функции правдоподобия вообще говоря не равен нулю.

Score:

\[ S(\beta) = \frac{\partial\ell(\beta)}{\partial\beta}. \]

Если

\[ S(\hat\beta_R) \]

велик после стандартизации, функция правдоподобия сильно «хочет» уйти от ограниченной поверхности — это свидетельство против \(H_0\).

Из условий Каруша—Куна—Таккера:

\[ S(\hat\beta_R) = G(\hat\beta_R)^\top\lambda_R, \]

где

\[ G(\beta) = \frac{\partial g(\beta)}{\partial\beta^\top}. \]

LM-статистика является стандартизированным квадратом score и при \(H_0\)

\[ \boxed{ LM\xrightarrow{d}\chi_q^2. } \]

17.1 14.1. Почему LM асимптотически похож на Wald?

Разложим score около \(\hat\beta_R\):

\[ S(\hat\beta) = S(\hat\beta_R) + H(\hat\beta_R)(\hat\beta-\hat\beta_R) + o_p(\|\hat\beta-\hat\beta_R\|), \]

где \(H\) — гессиан логарифмической функции правдоподобия.

Поскольку

\[ S(\hat\beta)=0, \]

получаем

\[ \boxed{ \hat\beta-\hat\beta_R \approx -H(\hat\beta_R)^{-1}S(\hat\beta_R). } \]

То есть:

  • Wald измеряет расстояние \(\hat\beta-\hat\beta_R\);
  • LM измеряет наклон \(S(\hat\beta_R)\);
  • кривизна \(H\) связывает эти две величины.

Именно поэтому при больших \(n\) Wald, LR и LM становятся эквивалентными.

17.2 14.2. Представление \(LM=nR_a^2\)

В линейной модели остатки ограниченной регрессии:

\[ \hat\varepsilon_R = Y-X\hat\beta_R. \]

Для нормальной гомоскедастической модели score пропорционален

\[ X^\top\hat\varepsilon_R. \]

Рассмотрим вспомогательную регрессию ограниченных остатков на соответствующие регрессоры. С

\[ P_X=X(X^\top X)^{-1}X^\top \]

получаем

\[ LM = \frac{1}{\hat\sigma_R^2} \hat\varepsilon_R^\top P_X \hat\varepsilon_R. \]

Так как

\[ \hat\sigma_R^2 = \frac{\hat\varepsilon_R^\top\hat\varepsilon_R}{n}, \]

а коэффициент детерминации вспомогательной регрессии равен

\[ R_a^2 = \frac{ \hat\varepsilon_R^\top P_X\hat\varepsilon_R }{ \hat\varepsilon_R^\top\hat\varepsilon_R }, \]

то

\[ \boxed{LM=nR_a^2.} \]

Интуиция: если ограниченная модель верна, в её остатках не должно оставаться сильной систематической структуры, объясняемой регрессорами.

18 15. Карта результатов: что требует нормальности?

TipВопрос

Какие результаты являются точными, а какие остаются доступными без нормальности ошибок?

Результат Нормальность ошибок нужна?
Формула МНК Нет
\(X^\top\hat\varepsilon=0\) Нет
\(SST=SSE+SSR\) при наличии константы Нет
Несмещённость при \(E(\varepsilon\mid X)=0\) Нет
Теорема Гаусса—Маркова (BLUE) Нет
Несмещённая оценка \(\sigma^2=SSR/(n-k)\) при гомоскедастичности Нет
Точное нормальное распределение \(\hat\beta\mid X\) Да
Точное \(t\)-распределение Да
Точный классический \(F\)-тест Да
Состоятельность МНК Нет, при соответствующих moment/exogeneity условиях
Асимптотическая нормальность МНК Нет, при регулярных условиях
Асимптотические Wald/LR/LM тесты Нет в общем случае, при регулярных условиях и корректной оценке ковариации

Главное различие:

\[ \boxed{ \text{нормальность} \Rightarrow \text{точная конечновыборочная инференция}, } \]

тогда как

\[ \boxed{ \text{без нормальности} \Rightarrow \text{инференция обычно строится асимптотически}. } \]

19 16. Небольшая симуляция: точная нормальность против асимптотики

Проверим, как распределение стандартизированной МНК-оценки ведёт себя при нормальных и ненормальных ошибках.

Показать Python-код
import numpy as np
import matplotlib.pyplot as plt

rng = np.random.default_rng(42)

n = 80
m = 5000
beta = np.array([1.0, 2.0])

x = np.linspace(-2, 2, n)
X = np.column_stack([np.ones(n), x])
XtX_inv = np.linalg.inv(X.T @ X)

def simulate(error_generator):
    vals = []
    for _ in range(m):
        eps = error_generator(n)
        y = X @ beta + eps
        bhat = XtX_inv @ X.T @ y
        vals.append(bhat[1])
    return np.asarray(vals)

normal = simulate(lambda n: rng.normal(size=n))
centered_exp = simulate(lambda n: rng.exponential(size=n) - 1)

scale = np.sqrt(XtX_inv[1, 1])

z_normal = (normal - beta[1]) / scale
z_exp = (centered_exp - beta[1]) / scale

fig, ax = plt.subplots(figsize=(8, 4.5))
ax.hist(z_normal, bins=45, density=True, alpha=0.5, label="Нормальные ошибки")
ax.hist(z_exp, bins=45, density=True, alpha=0.5, label="Центрированные экспоненциальные ошибки")

grid = np.linspace(-4, 4, 400)
phi = np.exp(-grid**2 / 2) / np.sqrt(2 * np.pi)
ax.plot(grid, phi, label="N(0,1)")
ax.set_xlabel("Стандартизированная оценка наклона")
ax.set_ylabel("Плотность")
ax.legend()
plt.show()

При нормальных ошибках нормальность \(\hat\beta\) является точной уже при фиксированном \(n\).

При ненормальных ошибках точной нормальности нет, но при увеличении \(n\) распределение стандартизированной оценки обычно приближается к нормальному благодаря ЦПТ.

20 17. Итоговая логика темы

Линейная регрессия полезна не только потому, что

\[ \hat\beta=(X^\top X)^{-1}X^\top Y \]

легко вычисляется. Важнее понимать, какие выводы можно делать при разных наборах предположений.

  1. Геометрия МНК даёт разложение \(Y=\hat Y+\hat\varepsilon\) и \(SST=SSE+SSR\).
  2. \(R^2\) измеряет качество подгонки, но автоматически выигрывает от дополнительных регрессоров; поэтому появляется \(R^2_{\mathrm{adj}}\).
  3. Нормальность не нужна ни для вычисления МНК, ни для BLUE-свойства.
  4. Нормальность даёт точные конечновыборочные распределения и классические \(t\)- и \(F\)-тесты.
  5. Без нормальности центральными становятся состоятельность и асимптотическая нормальность.
  6. Если известны истинные ограничения \(R\beta=r\), их можно встроить в оценивание и уменьшить дисперсию.
  7. Если ограничения лишь предполагаются, их проверяют с помощью Wald, LR, LM или классического \(F\)-теста в соответствующей постановке.

Таким образом, главный вопрос продвинутого анализа регрессии — не «как посчитать МНК?», а:

какие свойства оценки и какие процедуры инференции остаются корректными при том наборе предположений, который мы действительно готовы сделать?