定量方法(Quantitative Methods)— 简单线性回归 · 第 4 课
一、本课定位
| 课次 | 主题 | 核心能力 |
|---|---|---|
| L138 | OLS | 算出系数 |
| L139 | R² 与 F | 解释力与整体显著 |
| L140 | 回归假设与诊断 | 知道 OLS 何时可信、哪里会坏 |
| L141 | 定量终测 | 综合 15 题 |
🎯 CFA 一级不要求你手推 GLS,但会考:经典假设是什么?违反后 t/F/R² 怎么解读?
二、经典线性回归假设(简单回归)
记模型:(Y_i = b_0 + b_1 X_i + \varepsilon_i)。
| # | 假设 | 白话 |
|---|---|---|
| 1 | 线性 | 条件均值是 X 的线性函数 |
| 2 | 严格外生 / E(ε|X)=0 | 误差均值与 X 无关(无遗漏相关变量等) |
| 3 | 同方差 Homoskedasticity | Var(ε|X) = σ² 常数 |
| 4 | 无序列相关 | Cov(εi,εj)=0(i≠j);截面常默认成立,时序要小心 |
| 5 | 无完全共线性 | 简单回归:X 不能是常数(有变异) |
| 6 | 正态性(可选加强) | ε ~ N(0,σ²) → 精确 t/F 小样本 |
前 1–5(及大样本)保证 OLS 无偏/一致 且常规 SE 可用;正态性保证小样本精确 t/F。
考场常考名称与「违反后的后果」,不考长证明。
三、逐条拆解与 CFA 抓手
3.1 线性
- 若真实关系是对数、二次,硬套直线 → 设定错误(misspecification)
- 诊断:残差对 X 或 Ŷ 作图,看系统性弯曲
- 处理思路:变换变量(ln Y、ln X)、加多项式项(一级知道概念即可)
3.2 E(ε|X)=0(最关键)
违反常见原因:
| 原因 | 例子 |
|---|---|
| 遗漏变量 | 用教育解释工资却漏经验,且经验与教育相关 |
| 反向因果 | 用广告解释销量,销量也决定广告预算 |
| 测量误差 | X 测不准且与误差相关 |
后果:OLS 偏误且不一致 → 系数「方向都可能错」,t/F 失去意义。
3.3 同方差 vs 异方差(Heteroskedasticity)
- 同方差:残差「带宽」大致恒定
- 异方差:误差波动随 X 或 Ŷ 变化(如收入越高,支出离散越大)
| 项目 | 异方差下 |
|---|---|
| b₀、b₁ 的 OLS 点估计 | 仍无偏/一致(在其他假设下) |
| 常规 SE、t、F、置信区间 | 不可靠(常偏小 → 过度拒绝) |
| R² | 仍可作描述拟合,不依赖同方差 |
诊断:残差图「喇叭口」;一级知道 White / Breusch-Pagan 检验名称即可。
处理概念:稳健标准误(robust SE)、加权最小二乘 WLS。
3.4 序列相关(Autocorrelation)
多见于时间序列(本期误差与上期相关)。
| 项目 | 正自相关下(常见) |
|---|---|
| 系数点估计 | 通常仍一致 |
| 常规 SE | 往往低估 → t 虚高 |
| 典型场景 | 宏观回归、连续日/月收益建模不当 |
诊断名:Durbin-Watson(一级识名)。处理概念:HAC/Newey-West SE、改模型动态结构。
3.5 共线性
- 简单回归:X 几乎无变化 → 斜率估不准
- 多元(一级了解):自变量高度相关 → 系数 SE 变大、符号不稳;整体 F 可能仍显著而单个 t 不显著
3.6 正态性
- 大样本:中心极限 → t/F 近似仍可用
- 小样本且严重偏态/厚尾:临界值不准
- 异常值(outliers)/ 高杠杆点:可「撬动」回归线
四、残差诊断清单(实战)
画出 êi vs Ŷi 或 vs Xi:
| 图形模式 | 可能问题 |
|---|---|
| 随机散点、带宽均匀 | 较健康 |
| 弯刀/U 形 | 非线性 / 设定错误 |
| 喇叭口 | 异方差 |
| 时序残差「成串同号」 | 正自相关 |
| 个别点远离 | 异常值 |
标准化残差很大(如 |e|>3)→ 重点核查该观测。
五、假设违反「后果速查表」(必背)
| 违反 | 系数无偏/一致? | 常规 t/F 可信? |
|---|---|---|
| 纯异方差 | 是(其它 OK 时) | 否 |
| 序列相关 | 通常是 | 否 |
| 遗漏相关变量 / 内生 | 否 | 否 |
| 非正态(大样本) | 是 | 近似可用 |
| 非正态(小样本极端) | 是 | 存疑 |
口诀:内生最致命(点估计都坏);异方差/自相关先坏推断(SE)。
六、计算与判断示例
示例 1(异方差判断)
分析师报告:OLS 斜率显著(t=3.2),但残差图呈喇叭口,未用稳健 SE。
最恰当结论: 点估计仍可参考,但 t 检验可能不可靠,应报告稳健 SE 后再下结论。
示例 2(遗漏变量)
真实:(Wage = b_0 + b_1 Edu + b_2 Exp + \varepsilon)。
误设:只回归 Edu。若 Corr(Edu,Exp)>0 且 b₂>0,则 b₁ 的 OLS 向上偏。
→ 属于 E(ε|X)≠0,不是简单「R² 不够高」。
示例 3(DW 与自相关)
时序回归 DW 统计量接近 0 → 残差强正自相关迹象;接近 2 → 无明显一阶自相关(一级定性即可)。
示例 4(异常值)
n=20 的回归中,删除某一杠杆点后 b₁ 从 2.0 变为 0.3 且不再显著。
→ 结果对单点敏感,需核查数据/考虑稳健方法,不可盲目采信原 t 值。
七、与 L138–L139 的衔接
| 你已经会的 | 本课补的前提 |
|---|---|
| b₁ = Cov/Var | 公式永远算得出;含义依赖假设 |
| t = b₁/SE(b₁) | SE 公式默认同方差、无自相关 |
| R²、F | 描述与检验;检验的分布理论靠假设 |
SEE、R² 不要求误差正态;精确 t/F p 值在小样本下依赖正态(或渐近)。
八、练习题(10 题)
Q1. 异方差是指:
A. 误差均值不为 0
B. 误差方差随观测变化
C. 误差与误差相关
D. X 与 Y 非线性
Q2. 仅存在异方差(其他假设成立)时,OLS 斜率估计通常:
A. 有偏且不一致
B. 无偏/一致,但常规 SE 有误
C. 完全不能用
D. R² 必定为 0
Q3. 遗漏一个与 X 相关的重要变量,主要破坏:
A. 仅正态性
B. E(ε|X)=0
C. 仅同方差
D. 样本量
Q4. 时间序列回归中,残差「连成一片同号」,最可能是:
A. 异方差
B. 正自相关
C. 完全共线
D. R²>1
Q5. 简单回归中,X 几乎是常数,会导致:
A. R² 必然为 1
B. 斜率估计极不精确
C. 必然异方差
D. SSE=0
Q6. 关于稳健(异方差一致)标准误,正确的是:
A. 改变 b₁ 的点估计公式
B. 修正 SE,使 t 推断更可靠
C. 一定增大 R²
D. 消除遗漏变量偏误
Q7. 大样本下误差非正态:
A. OLS 一定有偏
B. t/F 常仍可近似使用
C. R² 无定义
D. 必须放弃回归
Q8. 残差对 Ŷ 呈明显 U 形,优先怀疑:
A. 完美共线
B. 函数形式/非线性
C. n 太小
D. R² 公式用错
Q9. 下列哪项「点估计与推断都不可信」?
A. 轻度非正态、n=500
B. 纯异方差、已用稳健 SE
C. 内生性/遗漏相关变量
D. 同方差且外生
Q10. CFA 一级对 Durbin-Watson 的恰当态度:
A. 会算全部临界值表
B. 知道可用于提示残差自相关
C. 它检验异方差
D. DW=2 表示完美拟合
九、答案与详解
| 题号 | 答案 | 详解 |
|---|---|---|
| Q1 | B | Var(ε) 非常数。C 是自相关。 |
| Q2 | B | 经典结论:点估计 OK,常规 SE 坏。 |
| Q3 | B | 遗漏相关变量 → 误差吞进遗漏部分,与 X 相关。 |
| Q4 | B | 时序成串同号 ≈ 正自相关。 |
| Q5 | B | Var(X)≈0 → b₁ 的分母极小,SE 极大。 |
| Q6 | B | Robust SE 不改系数公式,改推断。 |
| Q7 | B | 渐近正态 / CLT。 |
| Q8 | B | 系统弯曲 → 设定错误。 |
| Q9 | C | 内生:偏误+无效推断。 |
| Q10 | B | 一级识工具即可;DW 不测异方差,也不等于拟合优度。 |
十、CFA 一级核心考点
| 考点 | 一句话 |
|---|---|
| 假设清单 | 线性、外生、同方差、无自相关、X 有变异、(正态) |
| 异方差 | 系数还行,SE/t/F 常规版不可信 |
| 自相关 | 时序常见;SE 常被低估 |
| 内生/遗漏 | 最严重:不一致 |
| 诊断 | 残差图 + 检验名称(White、DW…) |
| 处理概念 | 稳健 SE、变换变量、补变量 |
📌 下一课 L141:定量模块终测(15 题)—— TVM → 统计 → 回归一条龙。
Quantitative Methods — Simple Linear Regression · Lesson 4
I. Where This Lesson Fits
| Lesson | Topic | Skill |
|---|---|---|
| L138 | OLS | Coefficients |
| L139 | R² & F | Fit and overall significance |
| L140 | Assumptions & diagnostics | When OLS inference is trustworthy |
| L141 | Quant final | 15 questions |
🎯 Level I will not ask you to derive GLS — it will ask what the classical assumptions are and what breaks when they fail.
II. Classical Assumptions (Simple Regression)
Model: (Y_i = b_0 + b_1 X_i + \varepsilon_i).
| # | Assumption | Plain English |
|---|---|---|
| 1 | Linearity | E(Y|X) is linear in X |
| 2 | E(ε|X)=0 | Errors mean-independent of X (exogeneity) |
| 3 | Homoskedasticity | Var(ε|X)=σ² constant |
| 4 | No serial correlation | Cov(εi,εj)=0 for i≠j |
| 5 | No perfect collinearity | X is not constant (has variation) |
| 6 | Normality (optional strengthening) | ε ~ N → exact small-sample t/F |
III. Failures and Consequences
Heteroskedasticity
- OLS slope still unbiased/consistent (if other assumptions hold)
- Usual SE, t, F unreliable (often too small → over-rejection)
- R² still a descriptive fit measure
- Names: White, Breusch-Pagan; fix concept: robust SE, WLS
Serial correlation (time series)
- Coefficients often still consistent
- Usual SE often understated
- Name: Durbin-Watson; fix concept: HAC/Newey-West SE
Endogeneity / omitted relevant correlated variable
- OLS biased and inconsistent — worst case
- t/F meaningless until the specification is fixed
Nonlinearity / wrong functional form
- Systematic curves in residual plots
- Transform variables or enrich specification
Collinearity
- Simple case: X barely varies → imprecise slope
- Multiple regression (awareness): large SE, unstable signs; joint F may still be significant
Normality
- Large n: CLT → approximate t/F OK
- Small n + heavy tails/outliers: exact critical values dubious
IV. Residual Checklist
| Pattern in ê vs Ŷ or X | Suspect |
|---|---|
| Random band, constant width | Healthier |
| U-shape / curve | Nonlinearity |
| Fan shape | Heteroskedasticity |
| Runs of same sign (time) | Positive autocorrelation |
| Isolated far points | Outliers / leverage |
V. Consequence Cheat Sheet
| Violation | Point estimates OK? | Usual t/F OK? |
|---|---|---|
| Pure heteroskedasticity | Yes | No |
| Serial correlation | Usually yes | No |
| Endogeneity / omitted correlated var | No | No |
| Non-normal, large n | Yes | Approx. yes |
Mnemonic: endogeneity kills estimates; hetero/auto first kill inference.
VI. Mini Examples
- Significant t but fan-shaped residuals, no robust SE → distrust the t until robust SE is used.
- Wage on education omitting experience (correlated, positive) → education coefficient biased upward.
- DW near 0 → strong positive residual AR hint; near 2 → little first-order AR.
- Dropping one leverage point flips b₁ and significance → results fragile.
VII. Practice (10 Questions)
Q1. Heteroskedasticity means:
A. E(ε)≠0 B. Error variance changes across observations C. Errors correlated with each other D. Nonlinear X–Y
Q2. Pure heteroskedasticity (else OK): OLS slope is usually
A. Biased & inconsistent B. Unbiased/consistent but usual SE wrong C. Unusable D. Forces R²=0
Q3. Omitting a relevant variable correlated with X mainly breaks:
A. Normality only B. E(ε|X)=0 C. Homoskedasticity only D. Sample size
Q4. Time-series residuals in long same-sign runs suggest:
A. Heteroskedasticity B. Positive autocorrelation C. Perfect collinearity D. R²>1
Q5. X almost constant in simple regression implies:
A. R²=1 B. Very imprecise slope C. Must be hetero D. SSE=0
Q6. Robust (hetero-consistent) SE:
A. Change the OLS formula for b₁ B. Fix SE so t-inference is more reliable C. Raise R² D. Remove omitted-variable bias
Q7. Non-normal errors, large n:
A. OLS biased B. t/F often still approximate C. R² undefined D. Must abandon regression
Q8. U-shaped residual plot vs Ŷ suggests:
A. Perfect collinearity B. Wrong functional form / nonlinearity C. n too small D. Bad R² algebra
Q9. Which makes both estimates and usual inference untrustworthy?
A. Mild non-normality, n=500 B. Pure hetero with robust SE C. Endogeneity D. Classical case
Q10. Durbin-Watson at Level I:
A. Memorize full critical tables B. Know it flags residual autocorrelation C. Tests heteroskedasticity D. DW=2 means perfect fit
VIII. Answers
| # | Ans | Note |
|---|---|---|
| Q1 | B | |
| Q2 | B | |
| Q3 | B | |
| Q4 | B | |
| Q5 | B | |
| Q6 | B | |
| Q7 | B | |
| Q8 | B | |
| Q9 | C | |
| Q10 | B |
IX. Level I Takeaways
| Topic | One-liner |
|---|---|
| Assumptions | Linear, exogenous, homo, no AR, X varies, (normal) |
| Hetero | Coeff OK; usual SE not |
| Auto | Common in time series; SE understated |
| Endogeneity | Inconsistent — fatal |
| Diagnostics | Residual plots + named tests |
| Fixes (concept) | Robust SE, transforms, better specification |
📌 Next — L141: Quantitative Methods module final (15 questions).