Seminar 5 in Applied Statistics
Предположим, что регрессионная модель удовлетворяет следующим условиям:
ГМ-1 Модель является линейной относительно оцениваемых параметров;
ГМ-2 \(\{(Y_i,X_i)\}_{i=1}^n\) — н.о.р. выборка, где \(X_i\) — \(k\)-мерный вектор регрессоров \((X_{i1},\ldots,X_{ik})\);
ГМ-3 Нет полной мультиколлинеарности, то есть выборочные реализации компонент \(X_i\) (которые являются векторами-столбцами матрицы регрессоров) образуют линейно независимый набор векторов в \(\mathbb R^n\) с вероятностью 1;
ГМ-4 Нулевое условное среднее ошибки: \[ E(\varepsilon_i\mid X_{i1},\ldots,X_{ik})=0; \]
ГМ-5 Гомоскедастичность ошибки: \[ V(\varepsilon_i\mid X_{i1},\ldots,X_{ik})=\mathrm{const}. \]
Теорема: если вышеперечисленные предположения выполнены, то МНК-оценки являются лучшими линейными несмещёнными оценками коэффициентов линейной модели — то есть, имеют самую низкую дисперсию в соответствующем классе оценок.
Рассмотрим \[ Y=X\beta+\varepsilon,\qquad V(\varepsilon\mid X)=\sigma^2I_n, \] и \[ \hat\beta=(X^\top X)^{-1}X^\top Y. \]
Для произвольного \(c\in\mathbb R^k\) достаточно доказать \[ V(c^\top\hat\beta)\le V(c^\top\tilde\beta) \] для любой другой линейной несмещённой оценки \(\tilde\beta\).
Любая линейная оценка имеет вид \[ \tilde\beta=a^\top Y. \] Из условной несмещённости: \[ E(\tilde\beta\mid X) =a^\top X\beta=\beta \quad\Longrightarrow\quad a^\top X=I_k. \]
Для МНК: \[ V(c^\top\hat\beta\mid X) =\sigma^2c^\top(X^\top X)^{-1}c. \]
Для \(\tilde\beta\): \[ V(c^\top\tilde\beta\mid X) =\sigma^2(ac)^\top(ac). \]
Пусть \[ P_X=X(X^\top X)^{-1}X^\top. \] Поскольку \(P_X\) — ортогональный проектор, \[ \|ac\|^2\ge \|P_Xac\|^2. \] Следовательно, \[ \begin{aligned} V(c^\top\tilde\beta\mid X) &\ge \sigma^2(ac)^\top P_X(ac)\\ &=\sigma^2c^\top a^\top X(X^\top X)^{-1}X^\top ac\\ &=\sigma^2c^\top(X^\top X)^{-1}c\\ &=V(c^\top\hat\beta\mid X), \end{aligned} \] где использовано \(a^\top X=X^\top a=I_k\).
Итак, МНК имеет минимальную дисперсию среди всех линейных несмещённых оценок. \(\square\)
Рассмотрим модель множественной регрессии \[ Y=X\beta+Z\gamma+\varepsilon,\qquad \beta\in\mathbb R,\quad \gamma\in\mathbb R^k, \] \[ V(\varepsilon\mid X,Z)=\sigma^2I_n,\qquad E(\varepsilon\mid X,Z)=0_n. \]
Докажите, что условная дисперсия МНК-оценки \(\beta\) имеет вид \[ V(\hat\beta\mid X,Z) = \frac{\sigma^2} {\sum_{i=1}^n(X_i-\bar X)^2(1-R_1^2)}, \] где \(R_1^2\) — коэффициент детерминации во вспомогательной регрессии \(X\) на \(Z\) (предполагая, что константа содержится в \(Z\)).
Пусть \[ Q_Z=I-P_Z \] — проектор на \(L(Z)^\perp\).
По теореме FWL: \[ \hat\beta=(X^\top Q_ZX)^{-1}X^\top Q_ZY. \]
Так как \(Q_Z^\top=Q_Z\) и \(Q_Z^2=Q_Z\), \[ \begin{aligned} V(\hat\beta\mid X,Z) &=(X^\top Q_ZX)^{-1} X^\top Q_Z(\sigma^2I_n)Q_ZX (X^\top Q_ZX)^{-1}\\ &=\frac{\sigma^2}{X^\top Q_ZX}. \end{aligned} \]
Но \[ X^\top Q_ZX =\|Q_ZX\|^2 =SSR_X, \] где \(SSR_X\) — сумма квадратов остатков регрессии \(X\) на \(Z\).
Поскольку \(Z\) содержит константу, \[ SSR_X=SST_X(1-R_1^2), \qquad SST_X=\sum_{i=1}^n(X_i-\bar X)^2. \]
Следовательно, \[ \boxed{ V(\hat\beta\mid X,Z) = \frac{\sigma^2} {\sum_{i=1}^n(X_i-\bar X)^2(1-R_1^2)} }. \]
Интерпретация: чем сильнее \(X\) объясняется остальными регрессорами \(Z\) (\(R_1^2\to1\)), тем больше дисперсия \(\hat\beta\). Это эффект мультиколлинеарности.
Докажите, что если модель множественной регрессии удовлетворяет условиям Гаусса-Маркова, то \[ E\hat\varepsilon_i=0. \]
Остатки: \[ \hat\varepsilon =Y-X\hat\beta =(I-P_X)Y. \]
Поэтому \[ \begin{aligned} E(\hat\varepsilon\mid X) &=(I-P_X)E(Y\mid X)\\ &=(I-P_X)X\beta\\ &=0, \end{aligned} \] поскольку \(P_XX=X\).
По закону повторного математического ожидания \[ E(\hat\varepsilon) = E\!\left[E(\hat\varepsilon\mid X)\right] =0. \]
Следовательно, для каждого \(i\): \[ \boxed{E\hat\varepsilon_i=0}. \]
Пусть истинная зависимость между \(X_i\) и \(Y_i\) имеет вид \[ Y_i=\beta_0+\beta_1X_i+\varepsilon_i \] и условия Гаусса-Маркова выполнены для выборки размером \(n\). Проанализируйте МНК-оценки параметров и \(R^2\) у каждой из следующих моделей:
\[ Y_i^*=\beta_0+\beta_1X_i+\varepsilon_i, \qquad Y_i^*=aY_i,\quad a\in\mathbb R; \]
\[ Y_i^*=\beta_0+\beta_1X_i+\varepsilon_i, \qquad Y_i^*=Y_i+b,\quad b\in\mathbb R; \]
\[ Y_i=\beta_0+\beta_1X_i^*+\varepsilon_i, \qquad X_i^*=cX_i,\quad c\in\mathbb R; \]
\[ Y_i=\beta_0+\beta_1X_i^*+\varepsilon_i, \qquad X_i^*=X_i+d,\quad d\in\mathbb R. \]
Пусть \(\hat\beta=(\hat\beta_0,\hat\beta_1)^\top\).
a) \(Y^*=aY\). \[ \hat\beta^* =(X^\top X)^{-1}X^\top(aY) =a\hat\beta. \] То есть \[ \boxed{\hat\beta_0^*=a\hat\beta_0,\qquad \hat\beta_1^*=a\hat\beta_1.} \] При ненулевом \(a\) корреляция меняется максимум знаком, поэтому её квадрат не меняется: \[ \boxed{R_*^2=R^2.} \]
b) \(Y^*=Y+b\). \[ \boxed{ \hat\beta_0^*=\hat\beta_0+b,\qquad \hat\beta_1^*=\hat\beta_1. } \] Добавление константы не меняет корреляцию: \[ \boxed{R_*^2=R^2.} \]
c) \(X^*=cX\). Для \(c\ne0\) пространство регрессоров не меняется: \[ L(1,X^*)=L(1,X). \] Следовательно, \(\hat Y\) и \(R^2\) те же, а \[ \boxed{ \hat\beta_0^*=\hat\beta_0,\qquad \hat\beta_1^*=\frac{\hat\beta_1}{c}, \qquad R_*^2=R^2. } \]
d) \(X^*=X+d\). Поскольку \(X=X^*-d\), \[ \hat\beta_0+\hat\beta_1X = (\hat\beta_0-\hat\beta_1d)+\hat\beta_1X^*. \] Поэтому \[ \boxed{ \hat\beta_1^*=\hat\beta_1,\qquad \hat\beta_0^*=\hat\beta_0-\hat\beta_1d, \qquad R_*^2=R^2. } \]
Во всех четырёх случаях соответствующее пространство подгонки не меняется (с точностью до масштабирования \(Y\) в a)), поэтому \(R^2\) инвариантен.
Рассмотрим уравнение \[ Y=(\alpha+\beta X)u, \] где \(Y\) и \(X\) — скалярные наблюдаемые, а \(u\) — ненаблюдаемая величина. Пусть \[ E(u\mid X)=1 \qquad\text{и}\qquad V(u\mid X)=\sigma^2. \] Как бы вы оценили параметры \((\alpha,\beta)\) методом наименьших квадратов? Как бы вы построили стандартные ошибки?
Несмотря на мультипликативную запись исходной модели, \[ E(Y\mid X) =(\alpha+\beta X)E(u\mid X) =\alpha+\beta X. \]
Поэтому её можно записать как линейную регрессию \[ Y=\alpha+\beta X+\varepsilon, \] где \[ \varepsilon=(\alpha+\beta X)(u-1), \qquad E(\varepsilon\mid X)=0. \]
Значит, \(\alpha\) и \(\beta\) можно оценивать обычным МНК.
Но \[ \begin{aligned} V(\varepsilon\mid X) &=(\alpha+\beta X)^2V(u-1\mid X)\\ &=\sigma^2(\alpha+\beta X)^2, \end{aligned} \] то есть ошибки гетероскедастичны.
Следовательно:
- коэффициенты оцениваем обычным МНК;
- обычная гомоскедастическая формула стандартных ошибок неприменима;
- используем робастные к гетероскедастичности стандартные ошибки.
\[ \boxed{\text{OLS coefficients + heteroskedasticity-robust standard errors}.} \]
Докажите, что в модели множественной регрессии с константой выполняется соотношение \[ R^2=\widehat{\operatorname{corr}}^{\,2}(\hat Y,Y). \]
Пусть \[ Y=\hat Y+\hat\varepsilon, \qquad \hat Y=X\hat\beta. \]
В модели с константой \[ \bar{\hat Y}=\bar Y, \qquad \sum_{i=1}^n\hat\varepsilon_i=0. \]
Центрируем: \[ \tilde Y=Y-\bar Y\mathbf1, \qquad \widetilde{\hat Y}=\hat Y-\bar Y\mathbf1. \]
Тогда \[ \tilde Y=\widetilde{\hat Y}+\hat\varepsilon, \] причём \[ \widetilde{\hat Y}\perp\hat\varepsilon. \]
Следовательно, \[ \langle \widetilde{\hat Y},\tilde Y\rangle = \|\widetilde{\hat Y}\|^2. \]
Теперь \[ R^2 = \frac{SSE}{SST} = \frac{\|\widetilde{\hat Y}\|^2}{\|\tilde Y\|^2}. \]
С другой стороны, \[ \widehat{\operatorname{corr}}^{\,2}(\hat Y,Y) = \frac{ \langle\widetilde{\hat Y},\tilde Y\rangle^2 }{ \|\widetilde{\hat Y}\|^2\|\tilde Y\|^2 }. \]
Используя \[ \langle\widetilde{\hat Y},\tilde Y\rangle =\|\widetilde{\hat Y}\|^2, \] получаем \[ \widehat{\operatorname{corr}}^{\,2}(\hat Y,Y) = \frac{\|\widetilde{\hat Y}\|^2}{\|\tilde Y\|^2} = R^2. \]
Итак, \[ \boxed{ R^2=\widehat{\operatorname{corr}}^{\,2}(\hat Y,Y). } \]
Предположим, у вас есть набор реализаций независимых и одинаково распределённых (н.о.р.) копий случайных величин \(Y\) и \(X\), и вы хотите оценить регрессионную модель
\[ Y_i=\alpha+\beta X_i+\varepsilon_i. \]
a) Каков вероятностный предел МНК-оценок этой модели (как обычно, \(\varepsilon\) — ненаблюдаемая ошибка регрессии)?
b) Каковы условия состоятельности МНК-оценки \(\hat\beta\)?
0.1 a) Вероятностный предел
Для парной регрессии с константой
\[ \hat\beta = \frac{\sum_{i=1}^n(Y_i-\bar Y)(X_i-\bar X)} {\sum_{i=1}^n(X_i-\bar X)^2}. \]
Подставим
\[ Y_i=\alpha+\beta X_i+\varepsilon_i. \]
Поскольку
\[ Y_i-\bar Y = \beta(X_i-\bar X)+(\varepsilon_i-\bar\varepsilon), \]
получаем
\[ \hat\beta = \beta+ \frac{ \frac1n\sum_{i=1}^n(\varepsilon_i-\bar\varepsilon)(X_i-\bar X) }{ \frac1n\sum_{i=1}^n(X_i-\bar X)^2 }. \]
По ЗБЧ
\[ \frac1n\sum_{i=1}^n(\varepsilon_i-\bar\varepsilon)(X_i-\bar X) \xrightarrow{p} \operatorname{cov}(\varepsilon,X), \]
а
\[ \frac1n\sum_{i=1}^n(X_i-\bar X)^2 \xrightarrow{p} V(X). \]
Следовательно,
\[ \boxed{ \operatorname{plim}\hat\beta = \beta+ \frac{\operatorname{cov}(\varepsilon,X)} {V(X)} }. \]
Для константы
\[ \hat\alpha=\bar Y-\hat\beta\bar X. \]
Поэтому
\[ \operatorname{plim}\hat\alpha = E(Y)-(\operatorname{plim}\hat\beta)E(X). \]
Так как
\[ E(Y)=\alpha+\beta E(X)+E(\varepsilon), \]
то
\[ \boxed{ \operatorname{plim}\hat\alpha = \alpha+E(\varepsilon) - E(X)\frac{\operatorname{cov}(\varepsilon,X)}{V(X)} }. \]
0.2 b) Состоятельность
Для состоятельности \(\hat\beta\) необходимо и достаточно, чтобы
\[ \operatorname{plim}\hat\beta=\beta. \]
Следовательно,
\[ \boxed{ \operatorname{cov}(\varepsilon,X)=0. } \]
То есть регрессор \(X\) должен быть некоррелирован с ошибкой регрессии.
Если мы также хотим состоятельность \(\hat\alpha\) для \(\alpha\), дополнительно необходимо
\[ E(\varepsilon)=0. \]
Таким образом,
\[ \boxed{ \operatorname{cov}(\varepsilon,X)=0 \quad\Longrightarrow\quad \hat\beta\xrightarrow{p}\beta. } \]
А при
\[ E(\varepsilon)=0, \qquad \operatorname{cov}(\varepsilon,X)=0, \]
имеем
\[ \boxed{ (\hat\alpha,\hat\beta) \xrightarrow{p} (\alpha,\beta). } \]
Пусть \(Y,X_1,\ldots,X_p,\varepsilon\) — набор случайных величин, где
\[ X=(X_1,\ldots,X_p)^T \]
и
\[ \operatorname{cov}(X,\varepsilon)=0_p. \]
Коэффициент \(\beta\) в линейной модели неизвестен:
\[ Y=X^T\beta+\varepsilon. \]
Предположим, что вектор \(X\) можно разделить на две группы:
\[ X=(D^T,W^T)^T, \]
где подвектор \(D\) размерности \(p_1\) представляет «целевые» регрессоры, а подвектор \(W\) размерности \(p_2\) представляет другие регрессоры, иногда называемые контрольными переменными. Уравнение принимает вид
\[ Y=D^T\beta_1+W^T\beta_2+\varepsilon. \]
Коэффициент \(\beta_1\) показывает, как меняется прогноз \(Y\) при изменении переменной \(D\) и фиксированных значениях \(W\). Это предполагает, что \(D\) предсказывает \(Y\) даже после исключения (линейного) влияния \(W\).
В генеральной совокупности определим оператор частичного исключения \(Q_W\), который берёт случайную величину \(V\) и создаёт \(\tilde V\) по правилу:
\[ Q_W(V)=\tilde V = V-W^T\gamma_{VW}, \]
где
\[ \gamma_{VW} = \arg\min_{b\in\mathbb R^{p_2}} E(V-W^Tb)^2. \]
Если \(V\) — случайный вектор, то применение оператора интерпретируется покомпонентно. Для корректного определения этого оператора необходимо, чтобы и \(V\), и \(W\) имели конечные вторые моменты.
a) Покажите, что \(Q_W\) является линейным оператором.
b) Примените \(Q_W\) к обеим сторонам уравнения. Будет ли результирующая ошибка регрессии некоррелирована с регрессорами? Выразите коэффициент регрессии \(\beta_1\) через \(\tilde Y\) и \(\tilde D\).
c) Как следует модифицировать \(Q_W\) в случае, если в уравнении модели присутствует квадратичная компонента от \(W\)?
0.3 a) Линейность \(Q_W\)
Из условия первого порядка для линейной проекции \(V\) на \(W\):
\[ E\left[W(V-W^T\gamma_{VW})\right]=0. \]
Следовательно,
\[ \gamma_{VW} = [E(WW^T)]^{-1}E(WV). \]
Поэтому для \(a\in\mathbb R\)
\[ \gamma_{aV,W} = [E(WW^T)]^{-1}E(WaV) = a\gamma_{VW}, \]
и
\[ Q_W(aV) = aV-W^T(a\gamma_{VW}) = aQ_W(V). \]
Аналогично,
\[ \gamma_{V+Z,W} = [E(WW^T)]^{-1} \{E(WV)+E(WZ)\} = \gamma_{VW}+\gamma_{ZW}, \]
откуда
\[ Q_W(V+Z) = Q_W(V)+Q_W(Z). \]
Следовательно,
\[ \boxed{ Q_W(aV+bZ) = aQ_W(V)+bQ_W(Z) } \]
и \(Q_W\) — линейный оператор.
0.4 b) Частичное исключение \(W\)
Исходная модель:
\[ Y=D^T\beta_1+W^T\beta_2+\varepsilon. \]
Применим \(Q_W\) к обеим частям. По линейности:
\[ Q_W(Y) = Q_W(D^T\beta_1) + Q_W(W^T\beta_2) + Q_W(\varepsilon). \]
Но
\[ Q_W(W^T\beta_2)=0. \]
Кроме того, из
\[ \operatorname{cov}(W,\varepsilon)=0 \]
следует, что линейная проекция \(\varepsilon\) на \(W\) равна нулю, поэтому
\[ Q_W(\varepsilon)=\varepsilon. \]
Обозначая
\[ \tilde Y=Q_W(Y), \qquad \tilde D=Q_W(D), \]
получаем
\[ \boxed{ \tilde Y=\tilde D^T\beta_1+\varepsilon. } \]
Проверим некоррелированность:
\[ \operatorname{cov}(\tilde D,\varepsilon) = \operatorname{cov} (D-W^T\gamma_{DW},\varepsilon). \]
Так как \(D\) и \(W\) являются компонентами \(X\) и
\[ \operatorname{cov}(X,\varepsilon)=0, \]
имеем
\[ \boxed{ \operatorname{cov}(\tilde D,\varepsilon)=0. } \]
Поэтому коэффициент регрессии в генеральной совокупности равен
\[ \boxed{ \beta_1 = [E(\tilde D\tilde D^T)]^{-1} E(\tilde D\tilde Y). } \]
Это и есть версия теоремы Фриша–Воу–Ловелла (FWL) для генеральной совокупности.
0.5 c) Если присутствует квадратичная компонента от \(W\)
Пусть теперь
\[ Y = D^T\beta_1 + W^T\beta_2 + W^TBW + \varepsilon, \]
где \(B\) — неслучайная квадратная матрица.
Обычного исключения только линейного влияния \(W\) теперь недостаточно: необходимо исключить как линейные, так и квадратичные функции \(W\).
Поэтому определяем
\[ \boxed{ Q_{\tilde W}(V) = V-W^T\gamma_{VW}-W^TB_VW, } \]
где коэффициенты выбираются из задачи
\[ \boxed{ (\gamma_{VW},B_V) = \arg\min_{b,B} E\left(V-W^Tb-W^TBW\right)^2. } \]
Идея остаётся той же: прежде чем оценивать влияние \(D\) на \(Y\), из обеих величин необходимо удалить всё влияние контрольных переменных \(W\), которое присутствует в исходной модели.