Standard II — Integrity of Capital Markets Module 1 · 15-20% Weight Lesson 140

📖 回归假设与诊断

Regression Assumptions and Diagnostics

定量方法(Quantitative Methods)— 简单线性回归 · 第 4 课


一、本课定位

课次 主题 核心能力
L138 OLS 算出系数
L139 R² 与 F 解释力与整体显著
L140 回归假设与诊断 知道 OLS 何时可信、哪里会坏
L141 定量终测 综合 15 题

🎯 CFA 一级不要求你手推 GLS,但会考:经典假设是什么?违反后 t/F/R² 怎么解读?


二、经典线性回归假设(简单回归)

记模型:(Y_i = b_0 + b_1 X_i + \varepsilon_i)。

# 假设 白话
1 线性 条件均值是 X 的线性函数
2 严格外生 / E(ε|X)=0 误差均值与 X 无关(无遗漏相关变量等)
3 同方差 Homoskedasticity Var(ε|X) = σ² 常数
4 无序列相关 Cov(εi,εj)=0(i≠j);截面常默认成立,时序要小心
5 无完全共线性 简单回归:X 不能是常数(有变异)
6 正态性(可选加强) ε ~ N(0,σ²) → 精确 t/F 小样本

前 1–5(及大样本)保证 OLS 无偏/一致 且常规 SE 可用;正态性保证小样本精确 t/F。

考场常考名称与「违反后的后果」,不考长证明。


三、逐条拆解与 CFA 抓手

3.1 线性

  • 若真实关系是对数、二次,硬套直线 → 设定错误(misspecification)
  • 诊断:残差对 X 或 Ŷ 作图,看系统性弯曲
  • 处理思路:变换变量(ln Y、ln X)、加多项式项(一级知道概念即可)

3.2 E(ε|X)=0(最关键)

违反常见原因:

原因 例子
遗漏变量 用教育解释工资却漏经验,且经验与教育相关
反向因果 用广告解释销量,销量也决定广告预算
测量误差 X 测不准且与误差相关

后果:OLS 偏误且不一致 → 系数「方向都可能错」,t/F 失去意义。

3.3 同方差 vs 异方差(Heteroskedasticity)

  • 同方差:残差「带宽」大致恒定
  • 异方差:误差波动随 X 或 Ŷ 变化(如收入越高,支出离散越大)
项目 异方差下
b₀、b₁ 的 OLS 点估计 仍无偏/一致(在其他假设下)
常规 SE、t、F、置信区间 不可靠(常偏小 → 过度拒绝)
R² 仍可作描述拟合,不依赖同方差

诊断:残差图「喇叭口」;一级知道 White / Breusch-Pagan 检验名称即可。
处理概念:稳健标准误(robust SE)、加权最小二乘 WLS。

3.4 序列相关(Autocorrelation)

多见于时间序列(本期误差与上期相关)。

项目 正自相关下(常见)
系数点估计 通常仍一致
常规 SE 往往低估 → t 虚高
典型场景 宏观回归、连续日/月收益建模不当

诊断名:Durbin-Watson(一级识名)。处理概念:HAC/Newey-West SE、改模型动态结构。

3.5 共线性

  • 简单回归:X 几乎无变化 → 斜率估不准
  • 多元(一级了解):自变量高度相关 → 系数 SE 变大、符号不稳;整体 F 可能仍显著而单个 t 不显著

3.6 正态性

  • 大样本:中心极限 → t/F 近似仍可用
  • 小样本且严重偏态/厚尾:临界值不准
  • 异常值(outliers)/ 高杠杆点:可「撬动」回归线

四、残差诊断清单(实战)

画出 êi vs Ŷi 或 vs Xi:

图形模式 可能问题
随机散点、带宽均匀 较健康
弯刀/U 形 非线性 / 设定错误
喇叭口 异方差
时序残差「成串同号」 正自相关
个别点远离 异常值

标准化残差很大(如 |e|>3)→ 重点核查该观测。


五、假设违反「后果速查表」(必背)

违反 系数无偏/一致? 常规 t/F 可信?
纯异方差 是(其它 OK 时) 否
序列相关 通常是 否
遗漏相关变量 / 内生 否 否
非正态(大样本) 是 近似可用
非正态(小样本极端) 是 存疑

口诀:内生最致命(点估计都坏);异方差/自相关先坏推断(SE)。


六、计算与判断示例

示例 1(异方差判断)

分析师报告:OLS 斜率显著(t=3.2),但残差图呈喇叭口,未用稳健 SE。
最恰当结论: 点估计仍可参考,但 t 检验可能不可靠,应报告稳健 SE 后再下结论。

示例 2(遗漏变量)

真实:(Wage = b_0 + b_1 Edu + b_2 Exp + \varepsilon)。
误设:只回归 Edu。若 Corr(Edu,Exp)>0 且 b₂>0,则 b₁ 的 OLS 向上偏。
→ 属于 E(ε|X)≠0,不是简单「R² 不够高」。

示例 3(DW 与自相关)

时序回归 DW 统计量接近 0 → 残差强正自相关迹象;接近 2 → 无明显一阶自相关(一级定性即可)。

示例 4(异常值)

n=20 的回归中,删除某一杠杆点后 b₁ 从 2.0 变为 0.3 且不再显著。
→ 结果对单点敏感,需核查数据/考虑稳健方法,不可盲目采信原 t 值。


七、与 L138–L139 的衔接

你已经会的 本课补的前提
b₁ = Cov/Var 公式永远算得出;含义依赖假设
t = b₁/SE(b₁) SE 公式默认同方差、无自相关
R²、F 描述与检验;检验的分布理论靠假设

SEE、R² 不要求误差正态;精确 t/F p 值在小样本下依赖正态(或渐近)。


八、练习题(10 题)

Q1. 异方差是指:
A. 误差均值不为 0
B. 误差方差随观测变化
C. 误差与误差相关
D. X 与 Y 非线性

Q2. 仅存在异方差(其他假设成立)时,OLS 斜率估计通常:
A. 有偏且不一致
B. 无偏/一致,但常规 SE 有误
C. 完全不能用
D. R² 必定为 0

Q3. 遗漏一个与 X 相关的重要变量,主要破坏:
A. 仅正态性
B. E(ε|X)=0
C. 仅同方差
D. 样本量

Q4. 时间序列回归中,残差「连成一片同号」,最可能是:
A. 异方差
B. 正自相关
C. 完全共线
D. R²>1

Q5. 简单回归中,X 几乎是常数,会导致:
A. R² 必然为 1
B. 斜率估计极不精确
C. 必然异方差
D. SSE=0

Q6. 关于稳健(异方差一致)标准误,正确的是:
A. 改变 b₁ 的点估计公式
B. 修正 SE,使 t 推断更可靠
C. 一定增大 R²
D. 消除遗漏变量偏误

Q7. 大样本下误差非正态:
A. OLS 一定有偏
B. t/F 常仍可近似使用
C. R² 无定义
D. 必须放弃回归

Q8. 残差对 Ŷ 呈明显 U 形,优先怀疑:
A. 完美共线
B. 函数形式/非线性
C. n 太小
D. R² 公式用错

Q9. 下列哪项「点估计与推断都不可信」?
A. 轻度非正态、n=500
B. 纯异方差、已用稳健 SE
C. 内生性/遗漏相关变量
D. 同方差且外生

Q10. CFA 一级对 Durbin-Watson 的恰当态度:
A. 会算全部临界值表
B. 知道可用于提示残差自相关
C. 它检验异方差
D. DW=2 表示完美拟合


九、答案与详解

题号 答案 详解
Q1 B Var(ε) 非常数。C 是自相关。
Q2 B 经典结论:点估计 OK,常规 SE 坏。
Q3 B 遗漏相关变量 → 误差吞进遗漏部分,与 X 相关。
Q4 B 时序成串同号 ≈ 正自相关。
Q5 B Var(X)≈0 → b₁ 的分母极小,SE 极大。
Q6 B Robust SE 不改系数公式,改推断。
Q7 B 渐近正态 / CLT。
Q8 B 系统弯曲 → 设定错误。
Q9 C 内生:偏误+无效推断。
Q10 B 一级识工具即可;DW 不测异方差,也不等于拟合优度。

十、CFA 一级核心考点

考点 一句话
假设清单 线性、外生、同方差、无自相关、X 有变异、(正态)
异方差 系数还行,SE/t/F 常规版不可信
自相关 时序常见;SE 常被低估
内生/遗漏 最严重:不一致
诊断 残差图 + 检验名称(White、DW…)
处理概念 稳健 SE、变换变量、补变量

📌 下一课 L141:定量模块终测(15 题)—— TVM → 统计 → 回归一条龙。

Quantitative Methods — Simple Linear Regression · Lesson 4


I. Where This Lesson Fits

Lesson Topic Skill
L138 OLS Coefficients
L139 R² & F Fit and overall significance
L140 Assumptions & diagnostics When OLS inference is trustworthy
L141 Quant final 15 questions

🎯 Level I will not ask you to derive GLS — it will ask what the classical assumptions are and what breaks when they fail.


II. Classical Assumptions (Simple Regression)

Model: (Y_i = b_0 + b_1 X_i + \varepsilon_i).

# Assumption Plain English
1 Linearity E(Y|X) is linear in X
2 E(ε|X)=0 Errors mean-independent of X (exogeneity)
3 Homoskedasticity Var(ε|X)=σ² constant
4 No serial correlation Cov(εi,εj)=0 for i≠j
5 No perfect collinearity X is not constant (has variation)
6 Normality (optional strengthening) ε ~ N → exact small-sample t/F

III. Failures and Consequences

Heteroskedasticity

  • OLS slope still unbiased/consistent (if other assumptions hold)
  • Usual SE, t, F unreliable (often too small → over-rejection)
  • R² still a descriptive fit measure
  • Names: White, Breusch-Pagan; fix concept: robust SE, WLS

Serial correlation (time series)

  • Coefficients often still consistent
  • Usual SE often understated
  • Name: Durbin-Watson; fix concept: HAC/Newey-West SE

Endogeneity / omitted relevant correlated variable

  • OLS biased and inconsistent — worst case
  • t/F meaningless until the specification is fixed

Nonlinearity / wrong functional form

  • Systematic curves in residual plots
  • Transform variables or enrich specification

Collinearity

  • Simple case: X barely varies → imprecise slope
  • Multiple regression (awareness): large SE, unstable signs; joint F may still be significant

Normality

  • Large n: CLT → approximate t/F OK
  • Small n + heavy tails/outliers: exact critical values dubious

IV. Residual Checklist

Pattern in ê vs Ŷ or X Suspect
Random band, constant width Healthier
U-shape / curve Nonlinearity
Fan shape Heteroskedasticity
Runs of same sign (time) Positive autocorrelation
Isolated far points Outliers / leverage

V. Consequence Cheat Sheet

Violation Point estimates OK? Usual t/F OK?
Pure heteroskedasticity Yes No
Serial correlation Usually yes No
Endogeneity / omitted correlated var No No
Non-normal, large n Yes Approx. yes

Mnemonic: endogeneity kills estimates; hetero/auto first kill inference.


VI. Mini Examples

  1. Significant t but fan-shaped residuals, no robust SE → distrust the t until robust SE is used.
  2. Wage on education omitting experience (correlated, positive) → education coefficient biased upward.
  3. DW near 0 → strong positive residual AR hint; near 2 → little first-order AR.
  4. Dropping one leverage point flips b₁ and significance → results fragile.

VII. Practice (10 Questions)

Q1. Heteroskedasticity means:
A. E(ε)≠0 B. Error variance changes across observations C. Errors correlated with each other D. Nonlinear X–Y

Q2. Pure heteroskedasticity (else OK): OLS slope is usually
A. Biased & inconsistent B. Unbiased/consistent but usual SE wrong C. Unusable D. Forces R²=0

Q3. Omitting a relevant variable correlated with X mainly breaks:
A. Normality only B. E(ε|X)=0 C. Homoskedasticity only D. Sample size

Q4. Time-series residuals in long same-sign runs suggest:
A. Heteroskedasticity B. Positive autocorrelation C. Perfect collinearity D. R²>1

Q5. X almost constant in simple regression implies:
A. R²=1 B. Very imprecise slope C. Must be hetero D. SSE=0

Q6. Robust (hetero-consistent) SE:
A. Change the OLS formula for b₁ B. Fix SE so t-inference is more reliable C. Raise R² D. Remove omitted-variable bias

Q7. Non-normal errors, large n:
A. OLS biased B. t/F often still approximate C. R² undefined D. Must abandon regression

Q8. U-shaped residual plot vs Ŷ suggests:
A. Perfect collinearity B. Wrong functional form / nonlinearity C. n too small D. Bad R² algebra

Q9. Which makes both estimates and usual inference untrustworthy?
A. Mild non-normality, n=500 B. Pure hetero with robust SE C. Endogeneity D. Classical case

Q10. Durbin-Watson at Level I:
A. Memorize full critical tables B. Know it flags residual autocorrelation C. Tests heteroskedasticity D. DW=2 means perfect fit


VIII. Answers

# Ans Note
Q1 B
Q2 B
Q3 B
Q4 B
Q5 B
Q6 B
Q7 B
Q8 B
Q9 C
Q10 B

IX. Level I Takeaways

Topic One-liner
Assumptions Linear, exogenous, homo, no AR, X varies, (normal)
Hetero Coeff OK; usual SE not
Auto Common in time series; SE understated
Endogeneity Inconsistent — fatal
Diagnostics Residual plots + named tests
Fixes (concept) Robust SE, transforms, better specification

📌 Next — L141: Quantitative Methods module final (15 questions).

🔜 下一课 · L141

定量模块终测(15 题)+ 讲评