定量方法(Quantitative Methods)— 简单线性回归 · 第 3 课
一、本课定位
| 课次 | 主题 | 核心能力 |
|---|---|---|
| L137 | 简单线性回归模型 | 读懂 Y = b₀ + b₁X + ε |
| L138 | 最小二乘法(OLS) | 算出 b₀、b₁ |
| L139 | R² 与 F 检验 | 判断模型解释力与整体显著性 |
| L140 | 回归假设与诊断 | 假设是否成立 |
| L141 | 定量模块终测 | 15 题综合 |
🎯 会算回归线还不够——考场更爱问:这条线解释了 Y 多少波动?模型整体有没有用?
二、我们要回答的两个问题
- 拟合好不好? → 用 R²(决定系数) 和 调整 R²
- 斜率整体是否显著不为 0? → 用 F 检验(简单回归里等价于斜率的 t 检验)
先把总波动拆开,一切公式都从这里来。
三、平方和分解(必背结构)
对任意观测 Yi:
$$Y_i - \bar{Y} = (\hat{Y}_i - \bar{Y}) + (Y_i - \hat{Y}_i)$$
两边平方并求和(交叉项在 OLS 下为 0):
| 名称 | 符号 | 含义 | 公式 |
|---|---|---|---|
| 总平方和 | SST (Total) | Y 相对均值的总波动 | Σ(Yi − Ȳ)² |
| 回归平方和 | SSR (Regression) | 模型解释掉的波动 | Σ(Ŷi − Ȳ)² |
| 误差平方和 | SSE (Error) | 模型解释不了的残差波动 | Σ(Yi − Ŷi)² |
恒等式(CFA 必考):
$$\mathbf{SST = SSR + SSE}$$
记忆:Total = Explained + Unexplained。有的教材把 SSR 叫 ESS、把 SSE 叫 RSS,以本题定义为准。
3.1 自由度
| 平方和 | 自由度(简单线性回归) |
|---|---|
| SST | n − 1 |
| SSR | k = 1(一个自变量) |
| SSE | n − 2 |
四、R²(决定系数)
4.1 定义
$$R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}$$
含义:自变量 X 解释了 Y 总波动的百分之多少。
| R² | 解读 |
|---|---|
| 0 | 模型完全没解释力(Ŷ 退化为 Ȳ) |
| 1 | 完美拟合(所有点落在线上,SSE=0) |
| 0.60 | 约 60% 的 Y 波动被 X 解释 |
CFA 提醒:R² 高 ≠ 因果关系;R² 低也可能斜率显著(尤其金融数据噪声大)。
4.2 简单回归的特殊关系
在只有一个自变量时:
$$R^2 = r_{XY}^2$$
即 R² 等于 X 与 Y 样本相关系数的平方。符号由相关系数 r 决定,R² 本身在 [0,1]。
4.3 计算示例 1
已知:SST = 200,SSE = 50,n = 22。
- SSR = SST − SSE = 150
- R² = 150/200 = 0.75
- 解读:模型解释了 Y 波动的 75%
4.4 计算示例 2(从相关系数)
股票超额收益与市场超额收益的相关系数 r = 0.80。
简单 CAPM 回归的 R² = 0.80² = 0.64。
五、调整 R²(Adjusted R²)
5.1 为什么需要调整?
普通 R² 永远不会因增加自变量而下降(在样本内)。乱加变量也能「刷高」R²。
调整 R² 对自变量个数惩罚:
$$R_a^2 = 1 - \left(\frac{n-1}{n-k-1}\right)(1-R^2)$$
其中 k = 自变量个数。简单回归 k=1,分母 = n−2。
5.2 性质(CFA 考点)
| 性质 | 说明 |
|---|---|
| R²ₐ ≤ R² | 通常严格小于(除非 R²=1) |
| 可增可减 | 加无关变量时 R²ₐ 可能下降 |
| 可为负 | 拟合极差时可能出现 |
| 模型比较 | 同因变量下比较多个模型,优先看 R²ₐ |
5.3 计算示例 3
R² = 0.75,n = 22,k = 1:
$$R_a^2 = 1 - \frac{21}{20}(1-0.75) = 1 - 1.05\times 0.25 = 1 - 0.2625 = 0.7375$$
六、F 检验:模型整体显著性
6.1 假设
简单线性回归:
- H₀: b₁ = 0(X 对 Y 无线性作用)
- Ha: b₁ ≠ 0
(多元时 H₀ 为「所有斜率同时为 0」)
6.2 F 统计量
$$F = \frac{MSR}{MSE} = \frac{SSR/k}{SSE/(n-k-1)}$$
简单回归 k=1:
$$F = \frac{SSR/1}{SSE/(n-2)} = \frac{SSR}{SSE/(n-2)}$$
- 在 H₀ 且经典假设下,F ~ F(k, n−k−1)
- 决策:F 很大 → 拒绝 H₀ → 模型整体显著
6.3 与 t 检验的关系(简单回归)
简单回归中:
$$F = t_{b_1}^2$$
对 b₁ 的双尾 t 检验与 F 检验结论完全一致。
多元回归才需要 F 来检验「整体」,单个系数仍用 t。
6.4 计算示例 4(接示例 1)
SSR=150,SSE=50,n=22,k=1:
- MSR = 150/1 = 150
- MSE = 50/20 = 2.5
- F = 150/2.5 = 60
查表或软件:F(1,20) 在 α=5% 临界值约 4.35。60 ≫ 4.35 → 拒绝 H₀,模型整体显著。
等价 t:t = √60 ≈ 7.75,|t| 很大,同样拒绝。
6.5 ANOVA 表(考场常直接给表)
| 来源 | SS | df | MS | F |
|---|---|---|---|---|
| 回归 | SSR | 1 | MSR=SSR/1 | MSR/MSE |
| 残差 | SSE | n−2 | MSE=SSE/(n−2) | |
| 总计 | SST | n−1 |
七、SEE 与 R² 的分工
| 指标 | 问的是什么 | 方向 |
|---|---|---|
| SEE = √MSE | 预测误差的典型大小(Y 的单位) | 越小越好 |
| R² | 解释了百分之多少波动 | 越大越好 |
| F / t | 是否统计显著 | 越大越易拒绝 H₀ |
同一模型:SSE ↓ → R² ↑、SEE ↓、F ↑,方向一致,但含义不同。
八、完整综合例
某分析师用月度数据(n=36)做股票收益对市场收益的回归:
- SST = 0.40,SSE = 0.16
求:SSR、R²、R²ₐ、F,并在 5% 水平下判断整体显著性。
解:
- SSR = 0.40 − 0.16 = 0.24
- R² = 0.24/0.40 = 0.60
- R²ₐ = 1 − (35/34)(0.40) = 1 − 1.0294×0.40 ≈ 0.588
- F = (0.24/1) / (0.16/34) = 0.24 / 0.004706 ≈ 51.0
- F(1,34) 5% 临界值约 4.1,51 ≫ 4.1 → 整体显著
九、练习题(10 题)
概念(Q1–Q5)
Q1. SST = SSR + SSE 中,SSE 代表:
A. 被模型解释的波动
B. 未被模型解释的残差波动
C. Y 的样本方差
D. 回归自由度
Q2. R² = 0 意味着:
A. 斜率一定为 0
B. 所有残差为 0
C. SSR = 0(模型未解释任何波动)
D. 相关系数为 1
Q3. 简单线性回归中,R² 等于:
A. 相关系数 r
B. r²
C. |r|
D. 1 − r²
Q4. 增加一个无关自变量后,通常:
A. R² 下降,R²ₐ 上升
B. R² 不降,R²ₐ 可能下降
C. 两者都必然上升
D. 两者都必然下降
Q5. 简单回归中 F 检验与 b₁ 的 t 检验:
A. 完全无关
B. F = t²,结论一致
C. F = t,结论一致
D. 只有单尾时一致
计算(Q6–Q8)
Q6. SST=100,SSR=64,则 R² =
A. 0.36 B. 0.64 C. 1.64 D. 36
Q7. n=32,k=1,R²=0.50,则 R²ₐ 最接近:
A. 0.48 B. 0.50 C. 0.52 D. 0.45
Q8. SSR=40,SSE=60,n=22,k=1,F =
A. 0.67 B. 2/3 C. 13.33 D. 40/60
综合(Q9–Q10)
Q9. ANOVA:回归 SS=30(df=1),残差 SS=70(df=28)。R² 与 F 为:
A. R²=0.30,F=12
B. R²=0.70,F=12
C. R²=0.30,F=0.43
D. R²=0.43,F=30
Q10. 下列正确的是:
A. R² 高就证明 X 导致 Y
B. R²ₐ 一定介于 0 与 1
C. 简单回归 F 显著 ⟺ b₁ 的 t 显著(同 α 双尾)
D. SEE 越大 R² 一定越大
十、答案与详解
| 题号 | 答案 | 详解 |
|---|---|---|
| Q1 | B | SSE = Σ(Yi−Ŷi)²,未解释波动。 |
| Q2 | C | R²=SSR/SST=0 ⇒ SSR=0。斜率在样本里对应 b₁=0,但选项 A 措辞「一定」易与总体混淆;标准表述是 SSR=0。 |
| Q3 | B | 单变量:R² = r²。 |
| Q4 | B | R² 单调不减;R²ₐ 有惩罚,可能降。 |
| Q5 | B | F = t²。 |
| Q6 | B | 64/100 = 0.64。 |
| Q7 | A | 1−(31/30)(0.5)=1−1.0333×0.5≈0.483。 |
| Q8 | C | F=(40/1)/(60/20)=40/3≈13.33。 |
| Q9 | A | R²=30/(30+70)=0.30;F=(30/1)/(70/28)=30/2.5=12。 |
| Q10 | C | A 因果谬误;B R²ₐ 可为负;D SEE 与 R² 反向。 |
十一、CFA 一级核心考点
| 考点 | 记忆要点 |
|---|---|
| 分解 | SST = SSR + SSE |
| R² | SSR/SST = 1 − SSE/SST |
| 单变量 | R² = r² |
| 调整 R² | 罚 k;比较模型用 R²ₐ |
| F | MSR/MSE;简单回归 F=t² |
| 决策 | F 大 → 整体显著 |
📌 下一课 L140:回归假设与诊断——OLS 什么时候「可信」?异方差、自相关怎么考?
Quantitative Methods — Simple Linear Regression · Lesson 3
I. Where This Lesson Fits
| Lesson | Topic | Skill |
|---|---|---|
| L137 | Simple linear regression model | Read Y = b₀ + b₁X + ε |
| L138 | OLS | Compute b₀, b₁ |
| L139 | R² and F-test | Explanatory power & overall significance |
| L140 | Assumptions & diagnostics | When OLS is reliable |
| L141 | Quant module final | 15-question exam |
🎯 Fitting a line is not enough. The exam asks: How much of Y’s variation is explained? Is the model useful overall?
II. Two Questions
- Goodness of fit? → R² and adjusted R²
- Is the slope jointly/overall significant? → F-test (in simple regression, equivalent to the t-test on b₁)
Start from the decomposition of total variation.
III. Sum-of-Squares Decomposition
$$Y_i - \bar{Y} = (\hat{Y}_i - \bar{Y}) + (Y_i - \hat{Y}_i)$$
Squaring and summing (cross-term is zero under OLS):
| Name | Symbol | Meaning | Formula |
|---|---|---|---|
| Total sum of squares | SST | Total variation of Y about its mean | Σ(Yi − Ȳ)² |
| Regression sum of squares | SSR | Variation explained by the model | Σ(Ŷi − Ȳ)² |
| Error sum of squares | SSE | Unexplained residual variation | Σ(Yi − Ŷi)² |
Identity (must memorize):
$$\mathbf{SST = SSR + SSE}$$
Degrees of Freedom (simple regression)
| SS | df |
|---|---|
| SST | n − 1 |
| SSR | k = 1 |
| SSE | n − 2 |
IV. Coefficient of Determination R²
$$R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}$$
Interpretation: fraction of the total variation in Y explained by X.
| R² | Reading |
|---|---|
| 0 | No explanatory power |
| 1 | Perfect fit (SSE = 0) |
| 0.60 | About 60% of variation explained |
High R² ≠ causation. Low R² can still have a significant slope (noisy financial data).
Simple regression special case
$$R^2 = r_{XY}^2$$
Example 1
SST = 200, SSE = 50, n = 22 → SSR = 150, R² = 0.75.
Example 2
Correlation r = 0.80 → R² = 0.64.
V. Adjusted R²
$$R_a^2 = 1 - \left(\frac{n-1}{n-k-1}\right)(1-R^2)$$
| Property | Note |
|---|---|
| R²ₐ ≤ R² | Usually strictly less |
| Can fall | Adding irrelevant regressors may lower R²ₐ |
| Can be negative | Very poor fit |
| Model comparison | Prefer R²ₐ when Y is the same |
Example 3
R² = 0.75, n = 22, k = 1 → R²ₐ = 0.7375.
VI. F-Test of Overall Significance
Hypotheses (simple regression):
H₀: b₁ = 0 Ha: b₁ ≠ 0
$$F = \frac{MSR}{MSE} = \frac{SSR/k}{SSE/(n-k-1)}$$
Large F → reject H₀ → model is overall significant.
Link to t-test
$$F = t_{b_1}^2$$
Same conclusion as the two-tailed t-test on b₁ in simple regression.
Example 4
SSR=150, SSE=50, n=22 → F = 150 / 2.5 = 60 → reject H₀ at 5%.
ANOVA table
| Source | SS | df | MS | F |
|---|---|---|---|---|
| Regression | SSR | 1 | SSR/1 | MSR/MSE |
| Residual | SSE | n−2 | SSE/(n−2) | |
| Total | SST | n−1 |
VII. SEE vs R² vs F
| Metric | Question | Better when |
|---|---|---|
| SEE = √MSE | Typical forecast error (units of Y) | Smaller |
| R² | % variation explained | Larger |
| F / t | Statistical significance | Larger (easier reject H₀) |
VIII. Worked Mini-Case
n=36, SST=0.40, SSE=0.16:
- SSR=0.24, R²=0.60, R²ₐ≈0.588, F≈51 → overall significant at 5%.
IX. Practice (10 Questions)
Q1. SSE measures:
A. Explained variation B. Unexplained residual variation C. Variance of Y D. Regression df
Q2. R² = 0 means:
A. Slope must be zero in population B. All residuals zero C. SSR = 0 D. r = 1
Q3. In simple regression, R² equals:
A. r B. r² C. |r| D. 1−r²
Q4. Adding an irrelevant regressor usually:
A. Lowers R², raises R²ₐ B. Does not lower R²; R²ₐ may fall C. Raises both always D. Lowers both always
Q5. In simple regression, F-test and t-test on b₁:
A. Unrelated B. F = t², same decision C. F = t D. Only one-tailed match
Q6. SST=100, SSR=64 → R² =
A. 0.36 B. 0.64 C. 1.64 D. 36
Q7. n=32, k=1, R²=0.50 → R²ₐ ≈
A. 0.48 B. 0.50 C. 0.52 D. 0.45
Q8. SSR=40, SSE=60, n=22, k=1 → F =
A. 0.67 B. 2/3 C. 13.33 D. 40/60
Q9. Regression SS=30 (df=1), residual SS=70 (df=28). R² and F:
A. 0.30 and 12 B. 0.70 and 12 C. 0.30 and 0.43 D. 0.43 and 30
Q10. Which is correct?
A. High R² proves causation B. R²ₐ always in (0,1) C. Simple-regression F significant ⇔ two-sided t on b₁ significant (same α) D. Larger SEE ⇒ larger R²
X. Answers
| # | Ans | Brief |
|---|---|---|
| Q1 | B | SSE = unexplained |
| Q2 | C | SSR/SST = 0 |
| Q3 | B | R² = r² |
| Q4 | B | R² non-decreasing; R²ₐ penalizes |
| Q5 | B | F = t² |
| Q6 | B | 0.64 |
| Q7 | A | ≈0.483 |
| Q8 | C | 40/3 ≈ 13.33 |
| Q9 | A | R²=0.30, F=12 |
| Q10 | C | A false; B can be negative; D opposite |
XI. Level I Takeaways
| Topic | Remember |
|---|---|
| Decomposition | SST = SSR + SSE |
| R² | SSR/SST |
| One regressor | R² = r² |
| Adjusted R² | Penalty for k |
| F | MSR/MSE; F = t² in simple regression |
📌 Next — L140: Assumptions and diagnostics.