Seminar 5 in Applied Statistics

Author

Carlos Buitrago

Предположим, что регрессионная модель удовлетворяет следующим условиям:

ГМ-1 Модель является линейной относительно оцениваемых параметров;

ГМ-2 \(\{(Y_i,X_i)\}_{i=1}^n\) — н.о.р. выборка, где \(X_i\) — \(k\)-мерный вектор регрессоров \((X_{i1},\ldots,X_{ik})\);

ГМ-3 Нет полной мультиколлинеарности, то есть выборочные реализации компонент \(X_i\) (которые являются векторами-столбцами матрицы регрессоров) образуют линейно независимый набор векторов в \(\mathbb R^n\) с вероятностью 1;

ГМ-4 Нулевое условное среднее ошибки: \[ E(\varepsilon_i\mid X_{i1},\ldots,X_{ik})=0; \]

ГМ-5 Гомоскедастичность ошибки: \[ V(\varepsilon_i\mid X_{i1},\ldots,X_{ik})=\mathrm{const}. \]

Теорема: если вышеперечисленные предположения выполнены, то МНК-оценки являются лучшими линейными несмещёнными оценками коэффициентов линейной модели — то есть, имеют самую низкую дисперсию в соответствующем классе оценок.

Рассмотрим \[ Y=X\beta+\varepsilon,\qquad V(\varepsilon\mid X)=\sigma^2I_n, \] и \[ \hat\beta=(X^\top X)^{-1}X^\top Y. \]

Для произвольного \(c\in\mathbb R^k\) достаточно доказать \[ V(c^\top\hat\beta)\le V(c^\top\tilde\beta) \] для любой другой линейной несмещённой оценки \(\tilde\beta\).

Любая линейная оценка имеет вид \[ \tilde\beta=a^\top Y. \] Из условной несмещённости: \[ E(\tilde\beta\mid X) =a^\top X\beta=\beta \quad\Longrightarrow\quad a^\top X=I_k. \]

Для МНК: \[ V(c^\top\hat\beta\mid X) =\sigma^2c^\top(X^\top X)^{-1}c. \]

Для \(\tilde\beta\): \[ V(c^\top\tilde\beta\mid X) =\sigma^2(ac)^\top(ac). \]

Пусть \[ P_X=X(X^\top X)^{-1}X^\top. \] Поскольку \(P_X\) — ортогональный проектор, \[ \|ac\|^2\ge \|P_Xac\|^2. \] Следовательно, \[ \begin{aligned} V(c^\top\tilde\beta\mid X) &\ge \sigma^2(ac)^\top P_X(ac)\\ &=\sigma^2c^\top a^\top X(X^\top X)^{-1}X^\top ac\\ &=\sigma^2c^\top(X^\top X)^{-1}c\\ &=V(c^\top\hat\beta\mid X), \end{aligned} \] где использовано \(a^\top X=X^\top a=I_k\).

Итак, МНК имеет минимальную дисперсию среди всех линейных несмещённых оценок. \(\square\)

Рассмотрим модель множественной регрессии \[ Y=X\beta+Z\gamma+\varepsilon,\qquad \beta\in\mathbb R,\quad \gamma\in\mathbb R^k, \] \[ V(\varepsilon\mid X,Z)=\sigma^2I_n,\qquad E(\varepsilon\mid X,Z)=0_n. \]

Докажите, что условная дисперсия МНК-оценки \(\beta\) имеет вид \[ V(\hat\beta\mid X,Z) = \frac{\sigma^2} {\sum_{i=1}^n(X_i-\bar X)^2(1-R_1^2)}, \] где \(R_1^2\) — коэффициент детерминации во вспомогательной регрессии \(X\) на \(Z\) (предполагая, что константа содержится в \(Z\)).

Пусть \[ Q_Z=I-P_Z \] — проектор на \(L(Z)^\perp\).

По теореме FWL: \[ \hat\beta=(X^\top Q_ZX)^{-1}X^\top Q_ZY. \]

Так как \(Q_Z^\top=Q_Z\) и \(Q_Z^2=Q_Z\), \[ \begin{aligned} V(\hat\beta\mid X,Z) &=(X^\top Q_ZX)^{-1} X^\top Q_Z(\sigma^2I_n)Q_ZX (X^\top Q_ZX)^{-1}\\ &=\frac{\sigma^2}{X^\top Q_ZX}. \end{aligned} \]

Но \[ X^\top Q_ZX =\|Q_ZX\|^2 =SSR_X, \] где \(SSR_X\) — сумма квадратов остатков регрессии \(X\) на \(Z\).

Поскольку \(Z\) содержит константу, \[ SSR_X=SST_X(1-R_1^2), \qquad SST_X=\sum_{i=1}^n(X_i-\bar X)^2. \]

Следовательно, \[ \boxed{ V(\hat\beta\mid X,Z) = \frac{\sigma^2} {\sum_{i=1}^n(X_i-\bar X)^2(1-R_1^2)} }. \]

Интерпретация: чем сильнее \(X\) объясняется остальными регрессорами \(Z\) (\(R_1^2\to1\)), тем больше дисперсия \(\hat\beta\). Это эффект мультиколлинеарности.

Докажите, что если модель множественной регрессии удовлетворяет условиям Гаусса-Маркова, то \[ E\hat\varepsilon_i=0. \]

Остатки: \[ \hat\varepsilon =Y-X\hat\beta =(I-P_X)Y. \]

Поэтому \[ \begin{aligned} E(\hat\varepsilon\mid X) &=(I-P_X)E(Y\mid X)\\ &=(I-P_X)X\beta\\ &=0, \end{aligned} \] поскольку \(P_XX=X\).

По закону повторного математического ожидания \[ E(\hat\varepsilon) = E\!\left[E(\hat\varepsilon\mid X)\right] =0. \]

Следовательно, для каждого \(i\): \[ \boxed{E\hat\varepsilon_i=0}. \]

Пусть истинная зависимость между \(X_i\) и \(Y_i\) имеет вид \[ Y_i=\beta_0+\beta_1X_i+\varepsilon_i \] и условия Гаусса-Маркова выполнены для выборки размером \(n\). Проанализируйте МНК-оценки параметров и \(R^2\) у каждой из следующих моделей:

  1. \[ Y_i^*=\beta_0+\beta_1X_i+\varepsilon_i, \qquad Y_i^*=aY_i,\quad a\in\mathbb R; \]

  2. \[ Y_i^*=\beta_0+\beta_1X_i+\varepsilon_i, \qquad Y_i^*=Y_i+b,\quad b\in\mathbb R; \]

  3. \[ Y_i=\beta_0+\beta_1X_i^*+\varepsilon_i, \qquad X_i^*=cX_i,\quad c\in\mathbb R; \]

  4. \[ Y_i=\beta_0+\beta_1X_i^*+\varepsilon_i, \qquad X_i^*=X_i+d,\quad d\in\mathbb R. \]

Пусть \(\hat\beta=(\hat\beta_0,\hat\beta_1)^\top\).

a) \(Y^*=aY\). \[ \hat\beta^* =(X^\top X)^{-1}X^\top(aY) =a\hat\beta. \] То есть \[ \boxed{\hat\beta_0^*=a\hat\beta_0,\qquad \hat\beta_1^*=a\hat\beta_1.} \] При ненулевом \(a\) корреляция меняется максимум знаком, поэтому её квадрат не меняется: \[ \boxed{R_*^2=R^2.} \]

b) \(Y^*=Y+b\). \[ \boxed{ \hat\beta_0^*=\hat\beta_0+b,\qquad \hat\beta_1^*=\hat\beta_1. } \] Добавление константы не меняет корреляцию: \[ \boxed{R_*^2=R^2.} \]

c) \(X^*=cX\). Для \(c\ne0\) пространство регрессоров не меняется: \[ L(1,X^*)=L(1,X). \] Следовательно, \(\hat Y\) и \(R^2\) те же, а \[ \boxed{ \hat\beta_0^*=\hat\beta_0,\qquad \hat\beta_1^*=\frac{\hat\beta_1}{c}, \qquad R_*^2=R^2. } \]

d) \(X^*=X+d\). Поскольку \(X=X^*-d\), \[ \hat\beta_0+\hat\beta_1X = (\hat\beta_0-\hat\beta_1d)+\hat\beta_1X^*. \] Поэтому \[ \boxed{ \hat\beta_1^*=\hat\beta_1,\qquad \hat\beta_0^*=\hat\beta_0-\hat\beta_1d, \qquad R_*^2=R^2. } \]

Во всех четырёх случаях соответствующее пространство подгонки не меняется (с точностью до масштабирования \(Y\) в a)), поэтому \(R^2\) инвариантен.

Рассмотрим уравнение \[ Y=(\alpha+\beta X)u, \] где \(Y\) и \(X\) — скалярные наблюдаемые, а \(u\) — ненаблюдаемая величина. Пусть \[ E(u\mid X)=1 \qquad\text{и}\qquad V(u\mid X)=\sigma^2. \] Как бы вы оценили параметры \((\alpha,\beta)\) методом наименьших квадратов? Как бы вы построили стандартные ошибки?

Несмотря на мультипликативную запись исходной модели, \[ E(Y\mid X) =(\alpha+\beta X)E(u\mid X) =\alpha+\beta X. \]

Поэтому её можно записать как линейную регрессию \[ Y=\alpha+\beta X+\varepsilon, \] где \[ \varepsilon=(\alpha+\beta X)(u-1), \qquad E(\varepsilon\mid X)=0. \]

Значит, \(\alpha\) и \(\beta\) можно оценивать обычным МНК.

Но \[ \begin{aligned} V(\varepsilon\mid X) &=(\alpha+\beta X)^2V(u-1\mid X)\\ &=\sigma^2(\alpha+\beta X)^2, \end{aligned} \] то есть ошибки гетероскедастичны.

Следовательно:

  • коэффициенты оцениваем обычным МНК;
  • обычная гомоскедастическая формула стандартных ошибок неприменима;
  • используем робастные к гетероскедастичности стандартные ошибки.

\[ \boxed{\text{OLS coefficients + heteroskedasticity-robust standard errors}.} \]

Докажите, что в модели множественной регрессии с константой выполняется соотношение \[ R^2=\widehat{\operatorname{corr}}^{\,2}(\hat Y,Y). \]

Пусть \[ Y=\hat Y+\hat\varepsilon, \qquad \hat Y=X\hat\beta. \]

В модели с константой \[ \bar{\hat Y}=\bar Y, \qquad \sum_{i=1}^n\hat\varepsilon_i=0. \]

Центрируем: \[ \tilde Y=Y-\bar Y\mathbf1, \qquad \widetilde{\hat Y}=\hat Y-\bar Y\mathbf1. \]

Тогда \[ \tilde Y=\widetilde{\hat Y}+\hat\varepsilon, \] причём \[ \widetilde{\hat Y}\perp\hat\varepsilon. \]

Следовательно, \[ \langle \widetilde{\hat Y},\tilde Y\rangle = \|\widetilde{\hat Y}\|^2. \]

Теперь \[ R^2 = \frac{SSE}{SST} = \frac{\|\widetilde{\hat Y}\|^2}{\|\tilde Y\|^2}. \]

С другой стороны, \[ \widehat{\operatorname{corr}}^{\,2}(\hat Y,Y) = \frac{ \langle\widetilde{\hat Y},\tilde Y\rangle^2 }{ \|\widetilde{\hat Y}\|^2\|\tilde Y\|^2 }. \]

Используя \[ \langle\widetilde{\hat Y},\tilde Y\rangle =\|\widetilde{\hat Y}\|^2, \] получаем \[ \widehat{\operatorname{corr}}^{\,2}(\hat Y,Y) = \frac{\|\widetilde{\hat Y}\|^2}{\|\tilde Y\|^2} = R^2. \]

Итак, \[ \boxed{ R^2=\widehat{\operatorname{corr}}^{\,2}(\hat Y,Y). } \]

Предположим, у вас есть набор реализаций независимых и одинаково распределённых (н.о.р.) копий случайных величин \(Y\) и \(X\), и вы хотите оценить регрессионную модель

\[ Y_i=\alpha+\beta X_i+\varepsilon_i. \]

a) Каков вероятностный предел МНК-оценок этой модели (как обычно, \(\varepsilon\) — ненаблюдаемая ошибка регрессии)?

b) Каковы условия состоятельности МНК-оценки \(\hat\beta\)?

0.1 a) Вероятностный предел

Для парной регрессии с константой

\[ \hat\beta = \frac{\sum_{i=1}^n(Y_i-\bar Y)(X_i-\bar X)} {\sum_{i=1}^n(X_i-\bar X)^2}. \]

Подставим

\[ Y_i=\alpha+\beta X_i+\varepsilon_i. \]

Поскольку

\[ Y_i-\bar Y = \beta(X_i-\bar X)+(\varepsilon_i-\bar\varepsilon), \]

получаем

\[ \hat\beta = \beta+ \frac{ \frac1n\sum_{i=1}^n(\varepsilon_i-\bar\varepsilon)(X_i-\bar X) }{ \frac1n\sum_{i=1}^n(X_i-\bar X)^2 }. \]

По ЗБЧ

\[ \frac1n\sum_{i=1}^n(\varepsilon_i-\bar\varepsilon)(X_i-\bar X) \xrightarrow{p} \operatorname{cov}(\varepsilon,X), \]

а

\[ \frac1n\sum_{i=1}^n(X_i-\bar X)^2 \xrightarrow{p} V(X). \]

Следовательно,

\[ \boxed{ \operatorname{plim}\hat\beta = \beta+ \frac{\operatorname{cov}(\varepsilon,X)} {V(X)} }. \]

Для константы

\[ \hat\alpha=\bar Y-\hat\beta\bar X. \]

Поэтому

\[ \operatorname{plim}\hat\alpha = E(Y)-(\operatorname{plim}\hat\beta)E(X). \]

Так как

\[ E(Y)=\alpha+\beta E(X)+E(\varepsilon), \]

то

\[ \boxed{ \operatorname{plim}\hat\alpha = \alpha+E(\varepsilon) - E(X)\frac{\operatorname{cov}(\varepsilon,X)}{V(X)} }. \]

0.2 b) Состоятельность

Для состоятельности \(\hat\beta\) необходимо и достаточно, чтобы

\[ \operatorname{plim}\hat\beta=\beta. \]

Следовательно,

\[ \boxed{ \operatorname{cov}(\varepsilon,X)=0. } \]

То есть регрессор \(X\) должен быть некоррелирован с ошибкой регрессии.

Если мы также хотим состоятельность \(\hat\alpha\) для \(\alpha\), дополнительно необходимо

\[ E(\varepsilon)=0. \]

Таким образом,

\[ \boxed{ \operatorname{cov}(\varepsilon,X)=0 \quad\Longrightarrow\quad \hat\beta\xrightarrow{p}\beta. } \]

А при

\[ E(\varepsilon)=0, \qquad \operatorname{cov}(\varepsilon,X)=0, \]

имеем

\[ \boxed{ (\hat\alpha,\hat\beta) \xrightarrow{p} (\alpha,\beta). } \]

Пусть \(Y,X_1,\ldots,X_p,\varepsilon\) — набор случайных величин, где

\[ X=(X_1,\ldots,X_p)^T \]

и

\[ \operatorname{cov}(X,\varepsilon)=0_p. \]

Коэффициент \(\beta\) в линейной модели неизвестен:

\[ Y=X^T\beta+\varepsilon. \]

Предположим, что вектор \(X\) можно разделить на две группы:

\[ X=(D^T,W^T)^T, \]

где подвектор \(D\) размерности \(p_1\) представляет «целевые» регрессоры, а подвектор \(W\) размерности \(p_2\) представляет другие регрессоры, иногда называемые контрольными переменными. Уравнение принимает вид

\[ Y=D^T\beta_1+W^T\beta_2+\varepsilon. \]

Коэффициент \(\beta_1\) показывает, как меняется прогноз \(Y\) при изменении переменной \(D\) и фиксированных значениях \(W\). Это предполагает, что \(D\) предсказывает \(Y\) даже после исключения (линейного) влияния \(W\).

В генеральной совокупности определим оператор частичного исключения \(Q_W\), который берёт случайную величину \(V\) и создаёт \(\tilde V\) по правилу:

\[ Q_W(V)=\tilde V = V-W^T\gamma_{VW}, \]

где

\[ \gamma_{VW} = \arg\min_{b\in\mathbb R^{p_2}} E(V-W^Tb)^2. \]

Если \(V\) — случайный вектор, то применение оператора интерпретируется покомпонентно. Для корректного определения этого оператора необходимо, чтобы и \(V\), и \(W\) имели конечные вторые моменты.

a) Покажите, что \(Q_W\) является линейным оператором.

b) Примените \(Q_W\) к обеим сторонам уравнения. Будет ли результирующая ошибка регрессии некоррелирована с регрессорами? Выразите коэффициент регрессии \(\beta_1\) через \(\tilde Y\) и \(\tilde D\).

c) Как следует модифицировать \(Q_W\) в случае, если в уравнении модели присутствует квадратичная компонента от \(W\)?

0.3 a) Линейность \(Q_W\)

Из условия первого порядка для линейной проекции \(V\) на \(W\):

\[ E\left[W(V-W^T\gamma_{VW})\right]=0. \]

Следовательно,

\[ \gamma_{VW} = [E(WW^T)]^{-1}E(WV). \]

Поэтому для \(a\in\mathbb R\)

\[ \gamma_{aV,W} = [E(WW^T)]^{-1}E(WaV) = a\gamma_{VW}, \]

и

\[ Q_W(aV) = aV-W^T(a\gamma_{VW}) = aQ_W(V). \]

Аналогично,

\[ \gamma_{V+Z,W} = [E(WW^T)]^{-1} \{E(WV)+E(WZ)\} = \gamma_{VW}+\gamma_{ZW}, \]

откуда

\[ Q_W(V+Z) = Q_W(V)+Q_W(Z). \]

Следовательно,

\[ \boxed{ Q_W(aV+bZ) = aQ_W(V)+bQ_W(Z) } \]

и \(Q_W\) — линейный оператор.


0.4 b) Частичное исключение \(W\)

Исходная модель:

\[ Y=D^T\beta_1+W^T\beta_2+\varepsilon. \]

Применим \(Q_W\) к обеим частям. По линейности:

\[ Q_W(Y) = Q_W(D^T\beta_1) + Q_W(W^T\beta_2) + Q_W(\varepsilon). \]

Но

\[ Q_W(W^T\beta_2)=0. \]

Кроме того, из

\[ \operatorname{cov}(W,\varepsilon)=0 \]

следует, что линейная проекция \(\varepsilon\) на \(W\) равна нулю, поэтому

\[ Q_W(\varepsilon)=\varepsilon. \]

Обозначая

\[ \tilde Y=Q_W(Y), \qquad \tilde D=Q_W(D), \]

получаем

\[ \boxed{ \tilde Y=\tilde D^T\beta_1+\varepsilon. } \]

Проверим некоррелированность:

\[ \operatorname{cov}(\tilde D,\varepsilon) = \operatorname{cov} (D-W^T\gamma_{DW},\varepsilon). \]

Так как \(D\) и \(W\) являются компонентами \(X\) и

\[ \operatorname{cov}(X,\varepsilon)=0, \]

имеем

\[ \boxed{ \operatorname{cov}(\tilde D,\varepsilon)=0. } \]

Поэтому коэффициент регрессии в генеральной совокупности равен

\[ \boxed{ \beta_1 = [E(\tilde D\tilde D^T)]^{-1} E(\tilde D\tilde Y). } \]

Это и есть версия теоремы Фриша–Воу–Ловелла (FWL) для генеральной совокупности.


0.5 c) Если присутствует квадратичная компонента от \(W\)

Пусть теперь

\[ Y = D^T\beta_1 + W^T\beta_2 + W^TBW + \varepsilon, \]

где \(B\) — неслучайная квадратная матрица.

Обычного исключения только линейного влияния \(W\) теперь недостаточно: необходимо исключить как линейные, так и квадратичные функции \(W\).

Поэтому определяем

\[ \boxed{ Q_{\tilde W}(V) = V-W^T\gamma_{VW}-W^TB_VW, } \]

где коэффициенты выбираются из задачи

\[ \boxed{ (\gamma_{VW},B_V) = \arg\min_{b,B} E\left(V-W^Tb-W^TBW\right)^2. } \]

Идея остаётся той же: прежде чем оценивать влияние \(D\) на \(Y\), из обеих величин необходимо удалить всё влияние контрольных переменных \(W\), которое присутствует в исходной модели.