# Day 14: 概率统计与推断基础 — 用数据做判断的底层数学

> **学习目标：** 从"凭感觉"升级到"凭数据"。今天结束之后，你应该能用贝叶斯定理从先验概率推算后验概率，能手工完成一个 t 检验并给出结论，能一眼识破别人图表和报告中的统计陷阱（幸存者偏差、辛普森悖论、伪相关）。统计不是算数，是思维方式。

> **核心问题：** 面对不确定性时，怎么用概率和统计的语言描述"我知道什么、我不知道什么、我有多大把握"？

> **为什么是两天：** 量化思维内容太多，拆为两天。今天聚焦"描述数据 + 推断结论"（概率论、贝叶斯、假设检验、置信区间），明天聚焦"建立模型 + 做出决策"（回归、ANOVA、因素分析、聚类、蒙特卡洛）。

> **与明天的关系：** 今天所有内容（概率、分布、检验）是明天所有模型（回归、ANOVA、聚类）的数学基础——如果今天没搞懂 p 值，明天的回归系数显著性检验就听不懂。

---

## 第一节：描述性统计 —— "平均"这个词骗了你多少次

> 老板说"我们团队平均薪资 6.5 万"，你觉得还不错。进去之后发现：9 个人拿 3.5-5.5 万，老板自己拿 300 万。"平均数"在数学上是诚实的，但你的直觉不一定是。描述性统计存在的全部意义，就是用一个或几个数字，把成千上万个数据点的"形状"讲清楚。问题在于：你选的数字对不对？

### 1.1 均值、中位数、众数 —— 三个"平均"，三种故事

> 一个数据集的"中心"在哪里？三种答案，各有各的用途，也各有各的坑。

#### 算术平均数（Mean）

> 最常用的"平均值"：把所有数加起来，除以个数。

**公式：** μ（总体均值）= (Σxᵢ)/N 或 x̄（样本均值）= (Σxᵢ)/n

**手工计算：团队薪资**

| 岗位 | 月薪（万元） |
|------|-------------|
| 实习 | 3.5 |
| 助理 | 3.8 |
| 专员 | 4.0 |
| 主管 | 4.2 |
| 经理 | 4.4 |
| 高级经理 | 4.5 |
| 副总监 | 4.7 |
| 总监 | 5.0 |
| 副总裁 | 5.5 |
| 老板 | 30.0 |

> 计算过程：3.5+3.8+4.0+4.2+4.4+4.5+4.7+5.0+5.5+30.0 = 69.6。n=10。均值 = 69.6/10 = 6.96 万元。老板说"平均 6.96 万"，数学上没毛病。但 9 个人收入都在 5.5 万以下。这个均值被一个极端值严重拉高了。

**加权平均数（Weighted Mean）**

> 当不同观测有不同的重要性时，用加权平均。

**投资组合回报案例：** 你有 100 万，30% 投股票 A（年回报 12%），70% 投股票 B（年回报 7%）。组合的加权平均回报是多少？

> w_A = 0.30，r_A = 12%；w_B = 0.70，r_B = 7%。加权均值 = 0.30×12% + 0.70×7% = 3.6% + 4.9% = 8.5%。这不是简单的 (12+7)/2 = 9.5% —— 后者假设等权重，但实际你的资金分配不是等权重的。

**几何平均数（Geometric Mean）**

> 算术平均会夸大复合增长的回报。几何平均是"复合增长率"的正确度量。

**公式：** G = (x₁ × x₂ × ... × xₙ)^(1/n)，或等价地：ln G = (1/n) × Σ ln(xᵢ)

**投资回报案例：** 某基金经理的三年回报分别是 +50%、-30%、+20%。算术平均 = (50-30+20)/3 = 13.3%。但你的钱实际上是怎么变的？

> 本金 100 万 → 第一年：100×(1+50%) = 150 → 第二年：150×(1-30%) = 105 → 第三年：105×(1+20%) = 126。从 100 到 126，三年总共增长 26%。年化复合增长率 = (126/100)^(1/3) - 1 = 1.26^(1/3) - 1 ≈ 8.0%。用几何平均公式：(1.50×0.70×1.20)^(1/3) = (1.26)^(1/3) = 1.080 → 几何平均回报 = 8.0%。

> **为什么几何平均是对的？** 因为投资回报是乘法过程（compound），不是加法过程。几何平均 = 8.0%，不是 13.3%。下次看到基金宣传"算术平均年化回报 13.3%"，你得看看他们是不是用错了平均数。

**修剪均值（Trimmed Mean）**

> 去掉极端值再算均值——体育比赛打分常用的"去掉一个最高分，去掉一个最低分"就是 10% 修剪均值。

团队薪资例子：去掉最低（3.5）和最高（30.0），计算剩余 8 个数：3.8+4.0+4.2+4.4+4.5+4.7+5.0+5.5 = 36.1。修剪均值 = 36.1/8 = 4.5125 万 —— 这才更接近"普通员工挣多少"。

#### 中位数（Median）

> 把所有数按大小排列，正中间的那个就是中位数。奇数个就是中间那个；偶数个就是中间两个的平均值。

团队薪资（已排序）：3.5, 3.8, 4.0, 4.2, 4.4, 4.5, 4.7, 5.0, 5.5, 30.0。n=10（偶数），取第 5 和第 6 个：4.4 和 4.5。中位数 = (4.4+4.5)/2 = 4.45 万元。

> 中位数 4.45 万，均值 6.96 万——差了一半还多。中位数告诉你的信息更真实："一半人拿不到 4.45 万，一半人超过 4.45 万。"

#### 众数（Mode）

> 出现频率最高的值。团队薪资这个例子没有重复值（每个岗位不同），所以没有众数。但在消费者偏好调查中非常有用：500 个人，165 人选品牌 A，110 人选品牌 B——品牌 A 就是众数。

**三个度量的使用场景：**

| 场景 | 用什么 | 原因 |
|------|--------|------|
| 收入/房价分布 | 中位数 | 严重右偏，均值被拉高 |
| 投资组合回报 | 几何平均 | 复合增长是乘法过程 |
| 次品率/合格率 | 算术均值 | 服从正态分布，无极端值 |
| 不同权重的考核 | 加权平均 | 各指标重要程度不同 |
| 消费者偏好 | 众数 | 关心"最常见的偏好是什么" |

#### 均值 vs 中位数：一个更极端的例子，帮你建立直觉

> 某 VC 基金投了 50 个项目。49 个归零了（回报 = -100%），1 个投中了独角兽，回报 = 10,000%（100 倍）。算术平均回报 = (49×(-100%) + 1×10000%)/50 = (-4900%+10000%)/50 = 5100%/50 = 102%。VC 基金宣传"我们的平均回报是 102%"——这在数学上正确，但在现实中是对实情的严重扭曲。中位数 = -100%（第 25 和第 26 个项目都是 -100%）。真相：**你投的这个基金，中位数回报是 -100%。** 大多数 LP 血本无归，只有一个 LP 暴富——"平均"把两个世界的事混在一起了。

#### 标准差的实际单位解读

> 前面算出来的股票 A 的 s = 0.144%。这到底意味着什么？如果日回报大约是正态分布的（这是个假设），那么大约 95% 的交易日回报在 x̄ ± 2s = 0.02% ± 2×0.144% = [-0.268%, 0.308%] 的区间内。换句话说，正常交易日这只股票跌不过 0.3%，涨不过 0.3%——按这个标准来看，一旦某天它跌了 1%，就至少是 7 个标准差的事件了，极为异常，值得查查新闻出了什么事。

---

### 1.2 方差、标准差与变异系数

> 均值告诉你"中心在哪"，方差告诉你"散得多开"。两只股票平均日回报都是 0.05%，但一只每天在 -2% 到 +2% 之间波动，另一只在 -0.5% 到 +0.6% 之间——你显然更想知道这个差别。

#### 方差（Variance）的手工计算

**公式：**

- 总体方差：σ² = Σ(xᵢ - μ)² / N
- 样本方差：s² = Σ(xᵢ - x̄)² / (n-1)

**完整手工计算 —— 两只股票 5 日回报对比：**

> 股票 A：日回报（%）= 0.05, -0.10, 0.20, -0.15, 0.10
> 股票 B：日回报（%）= 0.02, 0.01, 0.04, -0.01, 0.03

**股票 A 的方差计算：**

| 日 | 回报 xᵢ | xᵢ-x̄ | (xᵢ-x̄)² |
|----|---------|-------|----------|
| 1 | 0.05 | 0.05-0.02=0.03 | 0.0009 |
| 2 | -0.10 | -0.10-0.02=-0.12 | 0.0144 |
| 3 | 0.20 | 0.20-0.02=0.18 | 0.0324 |
| 4 | -0.15 | -0.15-0.02=-0.17 | 0.0289 |
| 5 | 0.10 | 0.10-0.02=0.08 | 0.0064 |

> 先算均值：x̄_A = (0.05-0.10+0.20-0.15+0.10)/5 = 0.10/5 = 0.02%。s²_A = Σ(xᵢ-x̄)²/(n-1) = (0.0009+0.0144+0.0324+0.0289+0.0064)/4 = 0.0830/4 = 0.02075。标准差 s_A = √0.02075 ≈ 0.144 ≈ 0.144%。

**股票 B 的方差计算：**

| 日 | 回报 xᵢ | xᵢ-x̄ | (xᵢ-x̄)² |
|----|---------|-------|----------|
| 1 | 0.02 | 0.02-0.018=0.002 | 0.000004 |
| 2 | 0.01 | 0.01-0.018=-0.008 | 0.000064 |
| 3 | 0.04 | 0.04-0.018=0.022 | 0.000484 |
| 4 | -0.01 | -0.01-0.018=-0.028 | 0.000784 |
| 5 | 0.03 | 0.03-0.018=0.012 | 0.000144 |

> x̄_B = (0.02+0.01+0.04-0.01+0.03)/5 = 0.09/5 = 0.018%。s²_B = (0.000004+0.000064+0.000484+0.000784+0.000144)/4 = 0.001480/4 = 0.00037。s_B = √0.00037 ≈ 0.0192%。

> **结论：** 两只股票日均回报差不多（0.02% vs 0.018%），但 A 的波动（σ≈0.144%）是 B（σ≈0.019%）的约 7.5 倍。股票 A 是"过山车型"，股票 B 是"慢走型"。方差把这种差异量化了。

#### 为什么分母是 n-1？（贝塞尔校正 Bessel's Correction）

> 这不是"数学家故意把题目变难"。当你用样本均值 x̄ 代替总体均值 μ 时，你已经用掉了一个"自由度"——你算出来的 x̄ 本身就离各个数据比 μ 离各个数据更近（因为 x̄ 就是最小化 ∑(xᵢ-c)² 的那个 c）。所以用 n-1 补偿这种"偏小"的偏差。

> **直觉理解：** 如果只抽 1 个数据，n=1，你能算出均值（就是那个数本身），但你能说出"数据散得多开"吗？不能。用 n，方差 = (x₁-x₁)²/1 = 0——这是胡说八道。用 n-1，分母 = 0，方差 = 未定义——这才诚实。

#### 变异系数（Coefficient of Variation, CV）

> 问题：某股票日波动 σ=0.5%，另一个市场债券日波动 σ=0.05%。但股票日均回报 0.2%，债券日均回报 0.01%。"波动"谁更大？

> σ 除以 μ：CV = σ/μ。CV_A = 0.5/0.2 = 2.5。CV_B = 0.05/0.01 = 5.0。债券的"每单位回报承担的波动"反而比股票大。CV 让你比较不同量级的东西——就像你不能因为大象吃得比老鼠多就说大象"更胖"，你要看饭量/体重比。

**工作量实例：百威亚太（1876.HK）季度收入波动**

> 以下是 8 个季度的收入数据（亿元，模拟数据）：

| 季度 | Q1 | Q2 | Q3 | Q4 | Q5 | Q6 | Q7 | Q8 |
|------|-----|-----|-----|-----|-----|-----|-----|-----|
| 收入 | 16.2 | 18.5 | 19.8 | 17.1 | 15.8 | 19.2 | 20.5 | 17.9 |

> 均值 x̄ = (16.2+18.5+19.8+17.1+15.8+19.2+20.5+17.9)/8 = 145.0/8 = 18.125 亿元

> 离差平方和：Σ(xᵢ-18.125)² = (16.2-18.125)² + (18.5-18.125)² + (19.8-18.125)² + (17.1-18.125)² + (15.8-18.125)² + (19.2-18.125)² + (20.5-18.125)² + (17.9-18.125)² = (-1.925)² + 0.375² + 1.675² + (-1.025)² + (-2.325)² + 1.075² + 2.375² + (-0.225)² = 3.706 + 0.141 + 2.806 + 1.051 + 5.406 + 1.156 + 5.641 + 0.051 = 19.958

> 样本标准差 s = √[19.958/(8-1)] = √2.851 = 1.689 亿元。CV = s/x̄ = 1.689/18.125 = 9.32%。作为参考，快消品行业季度收入 CV 通常在 5%-15% 之间，9.32% 属于正常波动。

#### 滚动标准差（Rolling Standard Deviation）——彭博终端怎么算"近期波动率"

> 固定一个窗口（比如 20 个交易日），每次窗口向前移动一天，重新计算这 20 天的标准差。今天算的是"过去 20 天的波动"，明天算的就是明天那 20 天的波动。彭博上看到的 20 天历史波动率（20-day Historical Volatility）就是这么来的。

---

### 1.3 偏度与峰度 —— 分布的形状，不只是均值和方差

> 均值和方差告诉你的只是"位置"和"宽度"。但两个分布可以有完全相同的均值和方差，形状却截然不同。

#### 偏度（Skewness）

> 偏度描述分布是否对称。负偏（左偏）：大部分值偏高，少数极端低值拖出一条"左尾巴"——像股价日回报，大部分日子涨涨跌跌幅度不大，但偶尔崩盘那天跌 10%。正偏（右偏）：大部分值偏低，少数极端高值拖出一条"右尾巴"——像初创公司退出估值，大部分 0-1000 万，极少数独角兽是几十亿。

**手工判断偏度方向（小数据集）：**

> 两组数据，每组 5 个数：
> 数据集 A：2, 3, 4, 5, 36 → 少数极端大值 → **正偏（右偏）**
> 数据集 B：-25, 3, 4, 5, 6 → 少数极端小值 → **负偏（左偏）**

> 快速判断法：均值 > 中位数 → 右偏（被大值拉上去）。均值 < 中位数 → 左偏（被小值拉下去）。均值 ≈ 中位数 → 近似对称。

> 数据集 A：均值 = (2+3+4+5+36)/5 = 10，中位数 = 4。均值 10 >> 中位数 4 → 右偏。
> 数据集 B：均值 = (-25+3+4+5+6)/5 = -1.4，中位数 = 4。均值 -1.4 << 中位数 4 → 左偏。

> **面试提示：** 投行/PE 面试中，"看分布先看 skewness"是个加分的回答。基金回报数据往往是负偏的（小赢 + 偶尔大亏），初创企业估值往往是正偏的（大部分失败，少数大赢）。

#### 偏度数值的粗略判断

> 偏度公式（样本）：Skew = [n/(n-1)(n-2)] × Σ[(xᵢ-x̄)/s]³。但面试中你不会被要求算这个。你需要的是**判断方向**和**大致量级**。规则：
> - |Skew| < 0.5：近似对称
> - 0.5 ≤ |Skew| < 1：中等偏斜
> - |Skew| ≥ 1：高度偏斜
> - 实际金融数据中，日回报的偏度通常在 -0.5 到 0 之间（轻微负偏），而 PE/VC 投资回报的偏度可以高达 3-5（极端正偏）。

#### 偏度在商业中的实战意义

> 两只股票的日均回报都是 0.05%，标准差都是 1.5%。从均值+方差的角度看，它们完全一样。但股票 A 是负偏（small frequent gains, occasional large crashes），股票 B 是正偏（small frequent losses, occasional large spikes）。哪只更危险？

> 如果你是做空波动率的策略（卖出期权，赚权利金），你极度讨厌负偏——一次 crash 就会爆仓。如果你是 VC 投资人，你的组合天然正偏——你需要偶尔的正偏事件（独角兽）来弥补大量失败项目。不同商业模式对偏度的偏好完全相反。面试中被问到"除了均值和方差你还看什么"，偏度就是你要说的那第三个维度。

#### 峰度（Kurtosis）

> 峰度描述的是"尾巴有多肥"——极端事件发生的频率有多高。不是说"分布尖不尖"，而是说"离均值 4 个标准差之外的概率有多大"。

> 正态分布的峰度 = 3（或超额峰度 = 0）。超额峰度 = 实际峰度 - 3。超额峰度 > 0 —— "肥尾"——极端事件发生的概率比正态分布预测的要高得多。

> **为什么金融数据不服从正态分布？** 因为金融市场有肥尾。标准普尔 500 日回报的样本峰度在 5-10 之间（超额峰度 2-7）。这意味着"黑色星期一"、"雷曼兄弟"这种事件在正态分布中概率是"千万年一遇"，但现实中它们每几年到几十年就发生一次。

---

### 1.4 相关系数 —— 两个变量"一起动"的程度

> 广告投得越多，销量越高？利率越低，房价越涨？——这些"关系"需要一个数字来量化："到底有多相关？"Pearson 相关系数 r 就是答案。r 在 -1 到 +1 之间：+1 完美正相关，-1 完美负相关，0 毫无线性关系。

#### Pearson r 的手工计算

**公式：** r = Σ(xᵢ-x̄)(yᵢ-ȳ) / √[Σ(xᵢ-x̄)² × Σ(yᵢ-ȳ)²]

**5 个月广告支出 vs 收入数据：**

| 月份 | 广告支出 X（万元）| 收入 Y（万元）|
|------|-------------------|---------------|
| 1 | 10 | 120 |
| 2 | 15 | 150 |
| 3 | 12 | 135 |
| 4 | 18 | 175 |
| 5 | 20 | 190 |

**完整计算步骤：**

> **Step 1：** 计算均值。x̄ = (10+15+12+18+20)/5 = 75/5 = 15。ȳ = (120+150+135+175+190)/5 = 770/5 = 154。

> **Step 2：** 计算离差及交叉乘积。

| 月 | X | Y | X-x̄ | Y-ȳ | (X-x̄)(Y-ȳ) | (X-x̄)² | (Y-ȳ)² |
|----|---|---|------|-----|-------------|---------|---------|
| 1 | 10 | 120 | -5 | -34 | 170 | 25 | 1156 |
| 2 | 15 | 150 | 0 | -4 | 0 | 0 | 16 |
| 3 | 12 | 135 | -3 | -19 | 57 | 9 | 361 |
| 4 | 18 | 175 | 3 | 21 | 63 | 9 | 441 |
| 5 | 20 | 190 | 5 | 36 | 180 | 25 | 1296 |

> **Step 3：** 求和。Σ(X-x̄)(Y-ȳ) = 170+0+57+63+180 = 470。Σ(X-x̄)² = 25+0+9+9+25 = 68。Σ(Y-ȳ)² = 1156+16+361+441+1296 = 3270。

> **Step 4：** 代入公式。r = 470 / √(68×3270) = 470 / √222360 = 470 / 471.55 = 0.997。

> **解释：** r = 0.997，几乎完美正相关。每多花一元广告，收入似乎就有响应。但注意——相关性不等于因果关系，我们将在第六节展开这个问题。

#### r 的解读标准

| r 绝对值 | 相关强度 | 含义 |
|----------|----------|------|
| 0.0 - 0.3 | 弱 | 可能只是噪音 |
| 0.3 - 0.7 | 中等 | 有关系，但不足以做确定预测 |
| 0.7 - 1.0 | 强 | 很强的线性关系 |

#### r² —— "解释了多少比例的方差"

> r = 0.8 听起来不错，但它的"解释力"只有 r² = 0.64 = 64%。意思是：Y 的总波动中，有 64% 可以被 X 的波动"解释"，剩下 36% 是 X 没说明白的东西（可能是其他变量，也可能是随机噪音）。

> 在我们的例子中，r = 0.997，r² = 0.994。广告支出可以解释 99.4% 的收入波动——这个数据太完美了，现实中几乎不会出现（如果出现，可能是作假了，或者二者根本不是"因果"关系，而是一个共同因子在驱动）。

#### 相关矩阵 —— 4 只股票的相关矩阵

> 假设我们有 4 只啤酒行业股票：百威亚太（BUD）、青岛啤酒（TSI）、华润啤酒（CRB）、朝日啤酒（ASB）的日回报相关系数矩阵：

|        | BUD  | TSI  | CRB  | ASB  |
|--------|------|------|------|------|
| **BUD** | 1.00 | 0.72 | 0.68 | 0.45 |
| **TSI** | 0.72 | 1.00 | 0.85 | 0.38 |
| **CRB** | 0.68 | 0.85 | 1.00 | 0.40 |
| **ASB** | 0.45 | 0.38 | 0.40 | 1.00 |

> **解读：**
> - 对角线全是 1.00（每只股票和自己的相关系数当然为 1）。
> - 矩阵是对称的（BUD 与 TSI 的相关 = TSI 与 BUD 的相关 = 0.72）。
> - 青岛啤酒和华润啤酒 r=0.85→高度相关（同在 A 股/港股市场，受相同的中国市场政策影响）。
> - 朝日啤酒与另外三只只在 0.38-0.45（日本市场+日元的独立驱动因素）。
> - 投资组合意义：如果你已经持有青岛和华润，再加华润分散效果有限。买点朝日则可能提供更好的分散化。

#### 相关系数的三个重要局限 —— 面试中可能被追问

> **1. 只测度线性关系。** r 衡量的是"线性相关"的程度，不是任何形式的关联。y = x² 是完美确定的抛物线关系，但 Pearson r ≈ 0。面试中如果有人说"r=0 所以二者无关"，你应该纠正："r=0 只说明没有线性关系，可能存在强烈的非线性关系。"

> **2. 对异常值极度敏感。** 回到我们的 5 个月广告支出例子，如果把第 5 个月的数据从 (20, 190) 改成 (20, 90)——收入从 190 暴跌到 90——r 会从 0.997 暴跌到约 -0.02。一个异常值就能毁掉一个相关性。这就是为什么 EDA（探索性数据分析）中**散点图是必画的**——你一眼就能看出那个偏离的点。

> **3. 相关的传导链。** 即使 r 是真实的（不是伪相关），相关性本身也不告诉你方向。是 X→Y，还是 Y→X，还是 Z→X 且 Z→Y？第六节将展开这个问题——这是"相关不等于因果"的核心。

---

## 第二节：概率论基础 —— 从"我觉得"到"概率是 X%"

> 概率论不是教你赌钱，而是给你一套应对不确定性的语言。"明天股市涨不涨？""这个项目能不能回本？""这个应聘者能不能胜任？"——你不能确定，但你可以量化。

### 2.1 概率公理与基本运算

**三大公理：**

1. **非负性：** 任何事件的概率 ≥ 0。P(A) ≥ 0。
2. **规范性：** 必然事件的概率 = 1。P(Ω) = 1。
3. **可加性：** 如果 A 和 B 互斥（不能同时发生），则 P(A 或 B) = P(A) + P(B)。

**补集规则：** P(非 A) = 1 - P(A)。百威亚太在某个季度 EPS 不达预期的概率是 35%，则达预期的概率 = 1-0.35 = 65%。

**加法规则（通用）：** P(A 或 B) = P(A) + P(B) - P(A 且 B)

> 为什么要减？因为如果 A 和 B 有重合，你数了两次。

**手工实例 —— 筛选啤酒公司：**

> 研究部跟踪了 200 家全球啤酒公司。定义：
> - A = ROE 超过 15%：P(A) = 0.30（60 家）
> - B = 年收入超过 100 亿元：P(B) = 0.25（50 家）
> - A 且 B（同时满足）：P(A∩B) = 0.10（20 家）

> 问：随机选一家，P(ROE>15% 或 收入>100亿)？
> P(A∪B) = 0.30 + 0.25 - 0.10 = 0.45 = 45%。

> 画个 Venn 图：左右两个圈交叠。左边圈 30%，右边圈 25%，交叠部分 10%。把左边圈和右边圈加起来时，交叠部分被数了两次，所以减掉一次。

---

### 2.2 条件概率 —— "在已知 X 的情况下，Y 的概率是多少"

> 条件概率是概率论最重要的概念，没有之一。它回答："当我掌握了新信息之后，概率怎么变？"贝叶斯定理（2.4 节）不过是这块的更系统化版本。

**定义：** P(A|B) = P(A∩B) / P(B)

> 读作："在 B 已经发生的条件下，A 发生的概率"。

**完整手工案例 —— 2×2 列联表：**

> 某 PE 基金跟踪了 250 笔历史投资：

|           | 经济上行 | 经济下行 | 合计 |
|-----------|---------|---------|------|
| 投资成功   | 120     | 30      | 150  |
| 投资失败   | 40      | 60      | 100  |
| 合计       | 160     | 90      | 250  |

> **无条件的成功概率**（你不知道任何宏观经济信息）：P(成功) = 150/250 = 0.60 = 60%。

> **条件概率 —— 已知经济上行：** P(成功∣上行) = 120/160 = 0.75 = 75%。
> 计算：P(成功∩上行) = 120/250 = 0.48。P(上行) = 160/250 = 0.64。P(成功∣上行) = 0.48/0.64 = 0.75。

> **条件概率 —— 已知经济下行：** P(成功∣下行) = 30/90 = 0.333 = 33.3%。

> **核心洞察：** P(成功∣上行) = 75% ≠ P(成功) = 60% ≠ P(成功∣下行) = 33.3%。宏观经济状况显著影响着投资成功的概率。如果一个变量已知之后概率不变（P(A|B) = P(A)），那 A 和 B 就是**独立**的。这里的投资成功和宏观经济不是独立的——这是常识，但我们现在有了数学证明。

---

### 2.3 全概率公式 —— "分情况讨论，再加权求和"

> 很多时候你不能直接算 P(B)，但你可以"分类讨论"：如果 A₁ 发生，P(B|A₁) 是多少；如果 A₂ 发生，P(B|A₂) 是多少……然后按 A₁、A₂……自身的概率加权求和。

**公式：** P(B) = P(B|A₁)·P(A₁) + P(B|A₂)·P(A₂) + ... + P(B|Aₙ)·P(Aₙ)

其中 A₁, A₂, ..., Aₙ 是一组互斥且穷尽的分割（partition）。

**完整手工案例 —— 三家工厂的次品率：**

> 某消费品公司有三个代工厂。工厂 1 承担 40% 的产量，历史次品率 2%。工厂 2 承担 35% 的产量，历史次品率 3%。工厂 3 承担 25% 的产量，历史次品率 1%。请问：随机从仓库抽一件产品，它是次品的概率是多少？

> **拆解：**
> - P(来自工厂1) = 0.40，P(次品∣工厂1) = 0.02
> - P(来自工厂2) = 0.35，P(次品∣工厂2) = 0.03
> - P(来自工厂3) = 0.25，P(次品∣工厂3) = 0.01

> **全概率公式：**
> P(次品) = 0.02×0.40 + 0.03×0.35 + 0.01×0.25
>        = 0.008 + 0.0105 + 0.0025
>        = 0.021
>        = 2.1%

> **直觉检验：** 三家工厂的次品率分别在 1%-3%，产量占比加权后 2.1% 落在范围内且偏低于中间值（因为最低次品率的工厂 3 有 25% 的权重，不算小），合理。

---

### 2.4 贝叶斯定理 —— "更新信念"的数学引擎

> 这是整个 Day 14 最重要的一节。贝叶斯定理告诉你：拿到新证据之后，你应该怎么从"先验信念"（Prior）更新到"后验信念"（Posterior）。面试中如果被你用贝叶斯框架分析问题，基本就是满分答案的节奏。

**公式：** P(A|B) = [P(B|A) × P(A)] / P(B)

其中分母 P(B) 可以用全概率公式计算：P(B) = P(B|A)·P(A) + P(B|非A)·P(非A)

**直观理解：** 后验概率 = (似然度 × 先验概率) / 证据的总概率。你有一个初始信念（Prior），你看到了新数据（Evidence），你更新你的信念（Posterior）。

---

#### 例 1：VC 投资 —— 看到了"连续创业者"这个信号

> **场景：** 你是一家 VC 的分析师。经验告诉你，投过的创业公司中大约 15% 最终成功退出。你知道一个规律：成功退出的公司中 60% 的创始人之前有过创业经历（连续创业者）；而失败的公司中只有 20% 的创始人是连续创业者。现在面前有一个新项目，创始人是连续创业者。问：这个项目成功的概率是多少？

> **定义事件：**
> - S = 成功退出，P(S) = 0.15（Prior）
> - C = 连续创业者
> - P(C|S) = 0.60（成功公司中有 60% 是连续创业者）
> - P(C|非S) = 0.20（失败公司中有 20% 是连续创业者）
> - P(非S) = 1 - 0.15 = 0.85

> **贝叶斯计算：**
> P(S|C) = [P(C|S) × P(S)] / [P(C|S) × P(S) + P(C|非S) × P(非S)]
>        = [0.60 × 0.15] / [0.60 × 0.15 + 0.20 × 0.85]
>        = 0.09 / [0.09 + 0.17]
>        = 0.09 / 0.26
>        = 0.3462
>        = 34.6%

> **解读：** 看到"连续创业者"这个信号之后，你的成功概率从 15% 提高到 34.6%——翻了超过一倍。但仍然只有三分之一左右的成功率。这件事本质上还是很难的，一个信号不能把不确定性变为确定性。贝叶斯告诉你：相信证据，但不要过度反应。

---

#### 例 2：医学检测 —— 为什么 99% 准确的检测也只意味着 9% 的得病概率

> 这是统计教育中最经典的例子，面试中经常出现。

> **场景：** 某种罕见病在总人口中的患病率是 0.1%（千分之一，一万人中 10 个）。有一种检测方法：灵敏度 = 99%（真生病的人，检测出来是阳性的概率 = 99%），特异性 = 99%（没生病的人，检测出来是阴性的概率 = 99%，也就是说假阳性率 = 1%）。你做了一次筛查，结果是阳性。问：你真正生病的概率是多少？

> **直觉陷阱：** 99% 准确 →"我 99% 生病了"——大错特错。

> **定义事件：**
> - D = 真正生病，P(D) = 0.001
> - + = 检测阳性
> - P(+|D) = 0.99（灵敏度）
> - P(+|非D) = 0.01（假阳性率，因为特异性 99%）
> - P(非D) = 0.999

> **贝叶斯计算：**
> P(D|+) = [P(+|D) × P(D)] / [P(+|D) × P(D) + P(+|非D) × P(非D)]
>        = [0.99 × 0.001] / [0.99 × 0.001 + 0.01 × 0.999]
>        = 0.00099 / [0.00099 + 0.00999]
>        = 0.00099 / 0.01098
>        = 0.0902
>        = 9.0%

> **震撼结论：** 尽管检测 99% 准确，但在阳性结果中，只有约 9% 的人真正生病。为什么？因为疾病太罕见了——每 1000 个人中有 1 个人生病（真阳性约 1 个），但有约 10 个人被误报为阳性（假阳性 = 1% × 999 ≈ 10）。所以在 11 个阳性结果中，只有 1 个是真的。

> **商业启示：** 这就是为什么大规模无差别筛查常常被质疑——当 base rate 很低时，即使测试准确率很高，阳性预测值（Positive Predictive Value）也可能很低。同样的逻辑适用于：招聘筛选、反欺诈系统、信用评分、尽职调查信号——如果 base rate 很低，一个"看起来异常"的信号并不意味着你真的找到了问题。

---

#### 例 3：信用风险 —— 低信用评分的借款人，违约概率是多少

> **场景：** 银行的历史数据显示，所有贷款申请人中有 5% 最终违约。已知：违约的人中有 80% 的信用评分低于 600；不违约的人中只有 15% 的信用评分低于 600。现在有一个申请人信用评分低于 600。他的违约概率是多少？

> **定义事件：**
> - D = 违约，P(D) = 0.05
> - L = 信用评分低于 600
> - P(L|D) = 0.80
> - P(L|非D) = 0.15
> - P(非D) = 0.95

> **贝叶斯计算：**
> P(D|L) = [0.80 × 0.05] / [0.80 × 0.05 + 0.15 × 0.95]
>        = 0.04 / [0.04 + 0.1425]
>        = 0.04 / 0.1825
>        = 0.2192
>        = 21.9%

> **解读：** 低信用评分将违约概率从 5% 提升到约 22%——显著提高，但远不到确定性。银行不会因为这一个人就拒绝所有低信用评分的申请人，但定价（利率）必须反应这个风险。这就是信用评分模型的底层逻辑。

---

## 第三节：概率分布 —— 描述"随机性"的数学语言

> 前面我们讲了怎么描述已经发生的数据（描述性统计）和概率怎么运算。现在的问题是：如果一个过程是随机的，结果出现的模式是什么样的？——这就是概率分布。

### 3.1 随机变量 —— 离散 vs 连续

> 一个随机变量就是一个结果不确定的数值变量。扔骰子之前，我不知道会出现 1 到 6 中的哪一个——但我知道每种结果的可能性。

**离散随机变量：** 只能取特定的、可数的值。例子：
- 今年完成的 M&A 交易数量：0, 1, 2, 3, ...
- 一个季度内收到违约通知的公司数
- 一次面试中答对的题目数

> 离散随机变量的概率用 PMF（Probability Mass Function，概率质量函数）描述。P(X=k) 是一个具体的概率值。

**连续随机变量：** 可以在一个区间内取任何值。例子：
- 某只股票今天的日回报：可能是 1.234%，也可能是 -0.567%
- 明天下午 2 点的气温
- 一瓶啤酒的实际灌装量（目标是 500ml，实际可能是 499.7ml, 500.3ml......）

> 连续随机变量的概率用 PDF（Probability Density Function，概率密度函数）描述。关键区别：**对于连续变量，P(X=某个精确值) = 0**——你不关心 P(回报=恰好 1.234%)，你关心 P(回报落在 1% 到 2% 之间)。用面积来算概率。

---

### 3.2 二项分布 —— "n 次独立试验，每次成功概率 p"

> 某 PE 看了 10 个项目，每个项目独立地有 30% 的概率通过初筛。问：恰好 4 个通过的概率是多少？

**PMF：** P(X=k) = C(n,k) × pᵏ × (1-p)ⁿ⁻ᵏ

其中 C(n,k) = n! / [k!(n-k)!]，读作"n 选 k"。

**完整手工计算：**

> n = 10（总共 10 个项目），p = 0.30（每个项目 30% 通过），k = 4（我们关心恰好 4 个通过）

> **Step 1：** 组合数 C(10,4) = 10!/(4!×6!) = (10×9×8×7)/(4×3×2×1) = 5040/24 = 210

> **Step 2：** pᵏ = 0.30⁴ = 0.30 × 0.30 × 0.30 × 0.30 = 0.0081

> **Step 3：** (1-p)ⁿ⁻ᵏ = 0.70⁶ = 0.70 × 0.70 × 0.70 × 0.70 × 0.70 × 0.70 = 0.117649

> **Step 4：** P(X=4) = 210 × 0.0081 × 0.117649 = 210 × 0.000953 = 0.2001 ≈ 20.0%

> **扩展计算 —— P(至少 1 个通过)：**
> P(X ≥ 1) = 1 - P(X=0) = 1 - C(10,0) × 0.30⁰ × 0.70¹⁰ = 1 - 1 × 1 × 0.02825 = 1 - 0.02825 = 0.97175 ≈ 97.2%

> 即使每个项目只有 30% 的通过率，看 10 个项目拿到至少一个好项目的概率也高达 97%。这就解释了为什么 PE/VC 必须大量看项目——单个项目的成功率并不重要，重要的是 pipeline 的广度。

#### 二项分布第二个实例——质量控制

> 某啤酒罐装线的次品率稳定在 2%。质检每批随机抽取 50 罐。问：在一批样品中恰好发现 0 罐次品的概率是多少？

> n=50，p=0.02，k=0。C(50,0) = 1。P(X=0) = 1 × 0.02⁰ × 0.98⁵⁰ = 0.98⁵⁰。计算：0.98⁵⁰ 用手算太麻烦，但可以用近似：ln(0.98⁵⁰) = 50 × ln(0.98) = 50 × (-0.0202) = -1.01。e^(-1.01) ≈ 0.364。所以约有 36.4% 的概率一个次品都找不到——尽管产线确实在持续产生次品（2% 次品率）。

> 问：至少发现 1 罐次品的概率？P(X ≥ 1) = 1 - P(X=0) = 1 - 0.364 = 63.6%。所以约三分之二的批次中会发现至少一罐次品——这决定了质检能不能"睡大觉"（不能，63.6% 的批次会触发警报）。

> **面试应用：** 二项分布是离散事件的"go-to distribution"。适用于"n 次独立试验，每次成功概率恒定"的场景。投行面试中出现的任何计数问题（几笔交易会违约、几个项目会成功、几个候选人会通过）都可以用二项分布框架来回答。

**二项分布的参数：**

| 参数 | 公式 | 本例 |
|------|------|------|
| 均值 E[X] | np | 10×0.30 = 3.0 |
| 方差 Var(X) | np(1-p) | 10×0.30×0.70 = 2.1 |
| 标准差 | √[np(1-p)] | √2.1 ≈ 1.45 |

---

### 3.3 正态分布 —— 为什么它无处不在

> 如果你这辈子只学一种概率分布，那就学正态分布。中心极限定理告诉我们：无论原始分布长什么样，只要样本量够大，样本均值的分布就近似正态。这就是为什么正态分布在实际中无处不在。

**PDF 公式（看看就好，不必背）：**

> f(x) = (1/(σ√(2π))) × exp(-(x-μ)²/(2σ²))

> 两个参数控制了形状：μ（均值）决定中心位置，σ（标准差）决定"宽度"——σ 越大，钟形曲线越扁越胖。

**Z 分数（Z-score）：** 

> Z = (X - μ) / σ。Z 是一个"单位换算"——把任何正态分布都转化到标准正态分布 N(0,1)，然后用同一张表查概率。"离均值几个标准差"——这就是 Z 的直观含义。

> 比如：你的身高比同龄人平均高 1.5 个标准差，Z = 1.5，对应大约前 6.7%（P(Z>1.5) ≈ 0.067）。

**完整手工案例 —— S&P 500 日回报概率：**

> 假设 S&P 500 日回报服从 N(μ=0.04%, σ=1.2%)。问：随机挑一天，日回报低于 -2% 的概率是多少？

> **Step 1：** 定义问题。求 P(X < -2%)

> **Step 2：** 计算 Z 分数。Z = (-2% - 0.04%) / 1.2% = -2.04 / 1.2 = -1.70

> **Step 3：** 查标准正态分布表。P(Z < -1.70) = 0.0446（查表：Z=1.70 → 0.0446）

> **Step 4：** 结论。大约 4.5% 的概率——换句话说，大约每 22 个交易日就有一天跌超 2%。这不是罕见事件。

**68-95-99.7 规则（经验法则）：**

| 范围 | 概率 | 金融含义（日回报 N(0.04%, 1.2%)） |
|------|------|----------------------------------|
| μ±1σ：-1.16% ~ 1.24% | 68% | 约三分之二的日子在这个范围内 |
| μ±2σ：-2.36% ~ 2.44% | 95% | 大多数日常波动在此范围内 |
| μ±3σ：-3.56% ~ 3.64% | 99.7% | 超出 ±3σ 在正态下概率仅 0.27%，但实际中并不罕见（肥尾问题） |

> **面试提示：** 当被问到"某事件发生的概率是多少"时，先判断能不能用正态分布近似，然后标准化，然后查 Z 表。这三个步骤在任何面试中都是满分回答的结构。

#### 第二个完整案例 —— 反向思维：从概率反推 z 值

> 一家投行的招聘笔试中，数学部分是正态分布评分 N(μ=70, σ=12)。前 10% 的考生进入面试轮。问：进入面试的最低分数是多少？

> **Step 1：** P(Z > z_cutoff) = 0.10 → P(Z ≤ z_cutoff) = 0.90

> **Step 2：** 查标准正态表，P(Z ≤ z) = 0.90 → z = 1.28（最常见的一个 z 值，建议记住：z=1.28 对应 90%，z=1.645 对应 95%，z=1.96 对应 97.5%，z=2.33 对应 99%）

> **Step 3：** X = μ + z×σ = 70 + 1.28×12 = 70 + 15.36 = 85.36。进入面试的最低分数大约 85 分。

> 这个技巧在 PE 的 Portfolio 分析中经常用到：给定回报分布 N(μ,σ)，"最差的 5%（VaR 阈值）在哪里？"——答案永远在 μ - 1.645σ。

**Q-Q 图（Quantile-Quantile Plot）概念：**

> 检查数据是否服从正态分布的最简单方法：把实际数据的分位数画在 y 轴，理论正态分布的分位数画在 x 轴。如果点大致落在一条直线上，则是正态分布。如果两头翘起（远离直线），则是肥尾。Q-Q 图不是计算工具，但面试中你说"我们先画个 Q-Q 图看看是不是正态分布"——这句话本身就展示了统计学素养。

> Q-Q 图的读法口诀：**中间离直线 → 偏度；两头翘 → 肥尾。** 实际投行研报中，很多研究员会用 Q-Q 图来论证"不应该用正态分布假设做风险建模"。

---

### 3.4a Z 表实战速查 —— 最常用的几个 Z 值

> 标准正态表中你真正需要记住的值只有这么几个。其他所有值都可以用这些做锚点来推算：

| Z 值 | P(Z ≤ z) | P(Z > z) | 含义 |
|------|----------|----------|------|
| 0.00 | 0.5000 | 0.5000 | 均值 |
| 1.00 | 0.8413 | 0.1587 | 约 1/6 的概率超过 1σ |
| 1.28 | 0.8997 | 0.1003 | 10% 尾部（面试常用） |
| 1.645 | 0.9500 | 0.0500 | α=0.05 单侧临界值 |
| 1.96 | 0.9750 | 0.0250 | 95% CI 双侧临界值 |
| 2.00 | 0.9772 | 0.0228 | 约 2.3% 概率超过 2σ |
| 2.33 | 0.9901 | 0.0099 | α=0.01 单侧临界值（99% VaR） |
| 2.58 | 0.9951 | 0.0049 | α=0.01 双侧临界值（99% CI） |
| 3.00 | 0.9987 | 0.0013 | "3-sigma" —— 正态下约 1/770 |

> **查表技巧：** 标准正态表通常给的是 P(Z ≤ z) 即从左边累计到 z 的面积。要求 P(Z > z)，用 1 减去这个值。要求 P(a < Z < b)，用 P(Z≤b) - P(Z≤a)。负 z 值利用对称性：P(Z < -z) = P(Z > z) = 1 - P(Z ≤ z)。

> **面试中最容易忘的一个：** α=0.05 双侧检验的临界值是 ±1.96（不是 1.645，1.645 是单侧的）。双侧的意思是你"不预设方向"——不管基金经理超额收益是正还是负，只要偏离 0 足够大就是异常。单侧是你"只关心一个方向"——只关心基金经理是否有"正"超额收益。搞清楚单侧还是双侧是面试中的基本要求。

### 3.4 肥尾问题 —— 为什么金融数据不服从正态分布

> 如果金融市场服从正态分布，1987 年黑色星期一的 22% 单日暴跌的概率大约是 10⁻⁵⁰——这个数字小到可以理解为"宇宙大爆炸以来一次都不会发生"。但它发生了。而且不止一次。

#### 正态分布 vs t 分布的尾部比较

> 同样是 5 个标准差事件（5-sigma event）：
> - 正态分布：P(|Z| > 5) ≈ 5.7 × 10⁻⁷，约 175 万分之一。如果每天一次试验，理论上是约 4800 年一遇。
> - t 分布（df=3）：P(|t| > 5) ≈ 0.005，约 200 分之一。大约每 200 个交易日就一次。

> S&P 500 自 1950 年以来的实际数据中，5-sigma 日发生了数十次——远多于正态分布的预测，少于 t(3) 的预测。经验结论：**金融数据大致介于正态和 t 分布之间**——比正态"肥"但不像 t(3) 那么极端。

#### 检查正态性的方法

**Jarque-Bera 检验（概念）：** 同时用偏度和峰度来检验正态性。如果数据是正态的：
- 偏度应该接近 0
- 超额峰度应该接近 0

> JB 统计量大（p 值小）→ 拒绝正态性假设。这是 EViews 等计量软件的标准输出之一——投行面试中你可能被问到"怎么看一个数据集是不是正态的"，Jarque-Bera 是标准答案。

#### 肥尾对风险管理意味着什么？

> 如果日回报真的有"肥尾"，那么用正态分布做风险建模会发生什么？举个例子：你是一个风险管理分析师，被要求计算 Daily VaR（Value at Risk，每日在险价值），也就是"在 99% 的置信度下，一天最多亏多少"。

> 如果日回报 ~ N(0%, 1.5%)，99% VaR = 0 + 2.33×1.5% = 3.5%。也就是说，在正态假设下，一天亏超过 3.5% 的概率只有 1%，即大约每 100 个交易日才出现一次。但如果真实分布是肥尾的（比如 t 分布，df=4），1% 分位点可能在 5% 左右——你低估了 1.5 个百分点。在 10 亿美元的 portfolio 上，1.5% 就是 1500 万美元的风险低估。

> **2008 年金融危机后，CFO 们要求 quant 团队不要只用正态分布做 VaR**——这个要求在投行面试中是个加分话题。你可以提一句："应该用历史模拟法或者极值理论（EVT，Extreme Value Theory）来校准肥尾风险。"

---

## 第四节：假设检验 —— 科学方法的统计实现

> 这是一百年来统计学最核心的方法论。"这个基金经理到底有没有 Alpha？""新药是不是真的比安慰剂有效？""A/B test 中 B 版本真的更好吗？"——这些问题要的不是"好像有"，而是"证据强到我们可以排除运气因素"。

### 4.1 假设检验的逻辑框架

> **核心隐喻：刑事审判。** H₀（原假设）= "被告是无辜的"。你收集证据。如果证据强到"在无辜假设下几乎不可能出现"，陪审团拒绝 H₀（判有罪）。但如果证据不够强呢？——只能说"没有足够的证据证明有罪"（未能拒绝 H₀）。你从来不说"证明了他无辜"。

**标准流程：**

1. 设立 H₀（零假设，通常代表"无效应/无差异"）和 H₁（备择假设）
2. 选择显著性水平 α（通常 0.05 或 0.01）——"我愿意接受多高的冤案率？"
3. 收集数据，计算检验统计量
4. 比较检验统计量与临界值，或比较 p 值与 α
5. 结论：Reject H₀（有显著证据）或 Fail to reject H₀（证据不足）

> **关键词：** 我们永远不"接受 H₀"。我们说"未能拒绝 H₀"——这两者有天壤之别。前者意味着"我证明它是对的"，后者意味着"证据不够，我不下结论"。

---

### 4.2 单样本 z 检验 —— 完整手工计算

> **实战案例 —— 基金经理 Alpha 检验：**

> 某基金经理声称他有 Alpha（选股能力），即他的组合月均超额收益 > 0。过去 36 个月，月均超额收益 x̄ = 0.45%，已知总体标准差 σ = 2.0%（行业经验值）。问：这些数据是否提供了"该基金经理有 Alpha"的充分证据？

> **Step 1 —— 设立假设：**
> H₀：μ = 0（没有 Alpha，超额收益为零）；H₁：μ > 0（有正 Alpha）
> 这是单侧检验（one-tailed），因为我们只关心"正 Alpha"，不是"有没有 Alpha（可以是正或负）"。

> **Step 2 —— 确定 α：**
> α = 0.05。意思是：我愿意接受 5% 的概率"把一个没有 Alpha 的人判为有 Alpha"（第一类错误）。

> **Step 3 —— 计算检验统计量：**
> z = (x̄ - μ₀) / (σ/√n) = (0.45 - 0) / (2.0/√36) = 0.45 / (2.0/6) = 0.45 / 0.3333 = 1.35

> 分母 σ/√n = 2.0/6 = 0.333% 是"均值标准误"（Standard Error of the Mean），意思是：如果原假设为真（μ=0），36 个月的样本均值会有多大的自然波动。

> **Step 4 —— 临界值：**
> 查 Z 表，α = 0.05 单侧 → z_critical = 1.645

> **Step 5 —— 比较：**
> 1.35 < 1.645 → **z 统计量未超过临界值 → 未能拒绝 H₀**

> **结论：** 尽管观测到了 0.45% 的月均超额收益，但这个量级下，数据不足以排除"运气"这个解释。我们**没有充分证据**说这位基金经理有真正的 Alpha。注意：我们没有说他"没有 Alpha"——我们只是说"证据不够"。

---

### 4.3 p 值 —— "数据有多极端"

> p 值 = 在原假设 H₀ 为真的前提下，观察到与我们所得一样极端（或更极端）的检验统计量的概率。

> **公式：** p-value = P(检验统计量 ≥ 观测到的值 | H₀ 为真)

**续前例 —— 计算 p 值：**

> 我们的 z = 1.35，单侧检验。查标准正态表：P(Z > 1.35) = 1 - P(Z ≤ 1.35) = 1 - 0.9115 = 0.0885。

> p = 0.0885。意味：如果这个基金经理真的没有 Alpha（μ=0），纯粹靠运气拿到 0.45% 以上月超额收益的概率大约是 8.9%。

> 比较：p = 0.0885 > α = 0.05 → 无法拒绝 H₀（与临界值方法的结论一致）。

#### 关于 p 值的常见错误理解（面试必考点）

| 错误说法 | 为什么错 |
|----------|----------|
| "p 值 = H₀ 为真的概率" | **严重错误。** p 值是 P(数据∣H₀)，不是 P(H₀∣数据)。这二者通过贝叶斯定理连接（还记得前面吗？），但在频率学派中，p 值不直接回答"假设有多可能是真的"。|
| "p > 0.05 意味着 H₀ 为真" | **错误。** 只是"证据不够"。可能样本太小，可能效应确实不存在。|
| "p < 0.05 意味着效应很大" | **错误。** p 值只告诉你"不太像随机噪音"，不告诉你效应大小。效应大小看 estimate（如 x̄-μ₀ = 0.45%），精度看置信区间。|
| "p < 0.05 意味着结论很重要" | **错误。** 巨大样本下，微小而不重要的效应也能显著。小样本下，重要的大效应也可能不显著。|

> **正确理解：** p 值是"在 H₀ 为真的前提下，数据看起来有多极端。"p 值小 → "在零假设下出现这种数据太不寻常了"→ 倾向于拒绝 H₀。p 值大 → "零假设下这种数据挺正常"→ 不能拒绝 H₀。

---

### 4.4 第一类错误与第二类错误

> 没有人是完美的，统计推断也一样。

|  | H₀ 为真（无效应）| H₀ 为假（有效应）|
|--|-----------------|-----------------|
| **拒绝 H₀** | Type I Error（α）——冤案 | 正确（Power = 1-β）|
| **未拒绝 H₀** | 正确（1-α） | Type II Error（β）——漏网 |

> **第一类错误（False Positive）：** 错杀好人。α = P(拒绝 H₀ ∣ H₀ 为真)。你设定 α = 0.05，就是接受了 5% 的冤案率。
>
> **第二类错误（False Negative）：** 放过坏人。β = P(未能拒绝 H₀ ∣ H₁ 为真)。换句话说：有效应存在，但你的检验没能检测到。
>
> **检验功效（Power）：** 1-β = 当有效应真实存在时，你成功检测到它的概率。

#### 一个将贝叶斯逻辑和假设检验结合的实例

> 某量化团队筛选了 100 个交易策略。实际上，其中 5 个是真正有效的（有真实 Alpha），95 个是噪音。设定 α = 0.05，Power = 0.80（80% 的有效策略会被正确检测到）。

> **预期结果：**
> - 真正有效的 5 个中，被正确检出的 = 5 × 0.80 = 4 个
> - 噪音中 95 个中，被错误检出的 = 95 × 0.05 ≈ 5 个
> - 总共 4+5 = 9 个策略被判为"显著"
> - **在被判为显著的那些策略中，真正有效的比例 = 4/9 ≈ 44%**

> **震撼结论：** 尽管 α = 0.05 和 Power = 0.80 看起来都是体面的参数，但在 base rate 很低（只有 5% 的策略有效）的情况下，超过一半的"显著"结果其实是噪音。这和第二节贝叶斯定理中罕见病筛查的逻辑完全一致——**α 和 p 值是筛子，但筛出来的东西有多可靠，取决于你要找的东西有多罕见。**

---

### 4.5 多重比较问题 —— "测试得越多，越容易撞上假阳性"

> 回忆第一节的掷硬币：扔 10 次硬币，连续 10 次正面的概率是 1/1024 ≈ 0.001。但如果有 1000 个人同时扔 10 次，至少有一个人拿到 10 次正面的概率 = 1-(1-0.001)^1000 ≈ 1-0.368 = 63.2%。——这几乎必然发生。

> 在统计检验中的含义：如果你同时检验 20 个独立的零假设，每个 α = 0.05，那么：
> P(至少 1 个假阳性) = 1 - (1-0.05)^20 = 1 - 0.95^20 = 1 - 0.358 = 0.642 = 64.2%

> **你做 20 个检验，有 64% 的概率至少碰上一个假阳性——即使所有 20 个零假设都是真的。** 这就是为什么基金公司"测试了几百个因子，最终发现了这个显著因子"这件事你需要高度怀疑。

#### 修正方法

**Bonferroni 校正（最保守）：**

> α_adjusted = α / m。检验 20 个假设，使用 α = 0.05/20 = 0.0025 才能维持整体第一类错误率在 5%。
> 代价巨大：Power 急剧下降，真正有效应可能也被过滤掉。

**Benjamini-Hochberg 过程（更实用，控制 False Discovery Rate）：**

> 概念层面：把所有 m 个检验的 p 值从小到大排序。设定一个可接受的假发现率（FDR，比如 5%）。确定一个阈值，使得在通过阈值的结果中，假阳性比例不超过 5%。具体的 p 值阈值不是 α/m 那样一刀切，而是根据每个 p 值的排位动态调整的。具体公式今天不讲，但面试中如果你提到 BH procedure 这个名字，已经比 95% 的人强了。

---

### 4.6 t 检验 —— 当你不认识真实的 σ

> z 检验要求你知道总体标准差 σ——这在实际中几乎是不可能的（如果你知道 σ，你大概率也知道 μ 了）。t 检验用样本标准差 s 替代 σ。代价是：检验统计量的分布不再是正态，而是 t 分布（更肥的尾巴，自由度越小越肥）。

**何时用 t 检验：** σ 未知，从样本中估计 s；小样本（n < 30）；需要更"保守"的推断。

**与前述完全相同的数据，但改用 t 检验：**

> 同一个基金经理，36 个月，x̄ = 0.45%，但这次我们不知道 σ，只知道样本标准差 s = 2.0%。H₀：μ = 0，H₁：μ > 0，α = 0.05。

> **Step 1：** t = (x̄ - μ₀) / (s/√n) = (0.45 - 0) / (2.0/√36) = 0.45 / 0.3333 = 1.35

> **Step 2：** 自由度 df = n-1 = 35。

> **Step 3：** 查 t 分布表，df=35，α=0.05 单侧：t_critical ≈ 1.690（t(35) 的临界值比 z 的 1.645 略大——因为尾巴更肥，你需要更强的证据才能拒绝 H₀）。

> **Step 4：** 1.35 < 1.690 → 未能拒绝 H₀。结论与 z 检验相同，但 t 检验更"挑剔"——这很合理，因为我们不确定 σ。

> **z 临界值 vs t 临界值对比：**

| df | z_crit (α=0.05单侧) | t_crit (α=0.05单侧) |
|----|---------------------|---------------------|
| 10 | 1.645 | 1.812 |
| 30 | 1.645 | 1.697 |
| 60 | 1.645 | 1.671 |
| 120 | 1.645 | 1.658 |
| ∞ | 1.645 | 1.645 |

> t 分布随 df 增大趋近正态分布。n ≥ 30 时，t 和 z 差距已经不大，但 n 越小差距越明显。

**其他常用 t 检验概览：**

**双样本 t 检验（Two-sample t-test）—— 完整手工实例：**

> 比较两个独立组的均值是否有差异。某咨询公司为百威亚太做消费者测试：80 个消费者随机分为两组，A 组品尝旧配方（对照组），B 组品尝新配方（实验组）。评分（满分 10 分）如下：

> A 组（旧配方，n₁=40）：x̄₁ = 6.8，s₁ = 1.5
> B 组（新配方，n₂=40）：x̄₂ = 7.5，s₂ = 1.4

> H₀：μ₁ = μ₂（新旧配方无差异），H₁：μ₁ ≠ μ₂（有差异），α = 0.05，双侧检验。

> **Step 1：** 合并标准误（假设等方差）：SE = √[s₁²/n₁ + s₂²/n₂] = √[1.5²/40 + 1.4²/40] = √[2.25/40 + 1.96/40] = √[0.05625 + 0.04900] = √0.10525 = 0.3244

> **Step 2：** t = (x̄₂ - x̄₁) / SE = (7.5-6.8)/0.3244 = 0.7/0.3244 = 2.16

> **Step 3：** 自由度 df ≈ n₁+n₂-2 = 78（使用 Welch 近似）。查 t 表，df=78，双侧 α=0.05 → t_crit ≈ 1.99。

> **Step 4：** 2.16 > 1.99 → 拒绝 H₀。新配方显著优于旧配方（p < 0.05）。

> **商业结论：** 新配方平均评分比旧配方高 0.7 分，且差异在统计上显著——建议推进新配方。

**配对 t 检验（Paired t-test）—— 概念 + 实例：**

> 双样本 t 检验处理的是两组独立的人或物。配对 t 检验处理的是**同一组对象在两种条件下的差异**。控制了个体差异，因此比双样本更有检验力（power 更大）。

> 实例：10 位分析师参加为期一周的财务建模培训。培训前后各完成一套相同难度的建模测试（满分 100 分）。

| 分析师 | 培训前 | 培训后 | 差值 d |
|--------|--------|--------|--------|
| 1 | 62 | 70 | +8 |
| 2 | 58 | 64 | +6 |
| 3 | 75 | 78 | +3 |
| 4 | 70 | 76 | +6 |
| 5 | 65 | 72 | +7 |
| 6 | 60 | 66 | +6 |
| 7 | 68 | 73 | +5 |
| 8 | 72 | 79 | +7 |
| 9 | 55 | 62 | +7 |
| 10 | 80 | 83 | +3 |

> 先算差值的均值和标准差：d̄ = (8+6+3+6+7+6+5+7+7+3)/10 = 58/10 = 5.8。差值的样本标准差 s_d：各 d 离差平方和 = (8-5.8)²+(6-5.8)²+(3-5.8)²+(6-5.8)²+(7-5.8)²+(6-5.8)²+(5-5.8)²+(7-5.8)²+(7-5.8)²+(3-5.8)² = (2.2)²+(0.2)²+(-2.8)²+(0.2)²+(1.2)²+(0.2)²+(-0.8)²+(1.2)²+(1.2)²+(-2.8)² = 4.84+0.04+7.84+0.04+1.44+0.04+0.64+1.44+1.44+7.84 = 25.60。s_d = √[25.60/9] = √2.844 = 1.686。

> t = d̄/(s_d/√n) = 5.8/(1.686/√10) = 5.8/0.533 = 10.88。df=9，双侧 t_crit(α=0.05,df=9) = 2.262。10.88 >> 2.262 → 极强的显著性。培训确实提升了建模能力。注意：配对检验的 t 值远大于双样本——因为"每个人当自己的对照"，个体间的基线差异被排除了，检验力更高。

---

## 第五节：置信区间 —— "我们有多确定"

> 假设检验告诉你一个"是/否"的答案。置信区间（Confidence Interval, CI）给你一个"范围"——效应有多大？估计有多精确？面试中，给出一个"点估计 + 95% CI"的回答总是优于只给点估计。

### 5.1 均值的置信区间

**公式（σ 已知）：** 95% CI = x̄ ± z_0.025 × σ/√n

**公式（σ 未知：**） 95% CI = x̄ ± t_0.025,df × s/√n

**续前例 —— 基金经理超额收益的 95% 置信区间：**

> x̄ = 0.45%，σ = 2.0%，n = 36。z_0.025 = 1.96（双侧 2.5% 的尾部）。

> 标准误（SE）= σ/√n = 2.0/6 = 0.3333%

> 误差边际（Margin of Error）= 1.96 × 0.3333% = 0.6533%

> 95% CI = 0.45% ± 0.653% = [-0.203%, 1.103%]

> **解读——正确方式：** 如果我们重复这个实验很多次（每次取 36 个月的数据，算一个 CI），那么这些 CI 中有 95% 会包含真实的 μ。
>
> **解读——错误方式：** "真实 μ 有 95% 的概率落在这个区间内。"在频率学派框架中这句话是错的——真值不是随机变量，它是固定的。CI 才是随机的。
>
> **解读——贝叶斯学派：** 贝叶斯学派有"可信区间"（Credible Interval），它的解释就是"μ 有 95% 概率落在此区间"。面试中如果能分清 Confidence Interval（频率学派）vs Credible Interval（贝叶斯学派），是非常强的加分项。

> **关键信息：** 95% CI 包含 0 → 不能拒绝 H₀：μ=0（双侧检验，α=0.05）。这与前面假设检验的结论一致——CI 和假设检验在数学上是等价的。

---

### 5.2 比例的置信区间

> 当你在做市场调研或用户调查时，你关心的不是连续变量的均值，而是一个比例（市场份额、满意度、转化率等）。

**公式（大样本，使用正态近似）：** 95% CI for p = p̂ ± z_0.025 × √[p̂(1-p̂)/n]

> 此处 p̂ 是样本比例，√[p̂(1-p̂)/n] 是标准误（SE）。

**完整实例 —— 消费者市场份额调查：**

> 某咨询公司受百威亚太委托，调查中国高端啤酒市场。随机抽样 500 名消费者，165 人首选品牌 A。p̂ = 165/500 = 0.330 = 33.0%。

> **Step 1：** 标准误 SE = √[p̂(1-p̂)/n] = √[0.33×0.67/500] = √[0.2211/500] = √0.0004422 = 0.02103

> **Step 2：** z_0.025 = 1.96。误差边际 = 1.96 × 0.02103 = 0.04122 ≈ 4.12 个百分点

> **Step 3：** 95% CI = [33.0% - 4.12%, 33.0% + 4.12%] = [28.88%, 37.12%]

> **解读：** 我们有 95% 的置信度认为品牌 A 的真实市场份额在 28.9% 到 37.1% 之间。误差边际约 4.1%（常被称为"抽样误差 ±4.1%"）。

**样本量如何影响 CI 宽度：**

> 标准误 ∝ 1/√n。如果样本量翻倍（500→1000），SE 缩小为原来的 1/√2 ≈ 0.707 倍。CI 宽度同步缩小为原来的 71%。想要 CI 宽度减半 → 需要样本量翻四倍。这是"为什么好的调查这么贵"的数学解释。

---

### 5.3 CI vs 假设检验的关系

| 假设检验 | 置信区间 |
|----------|----------|
| 二元的：显著 / 不显著 | 连续的：效应大小的可能取值范围 |
| 不告诉你效应有多大 | 直接给出效应大小的范围 + 精度 |
| 易于误解 p 值 | 更直观，不容易被滥用 |

> **等价关系：** 在双侧检验中，95% CI 不包含 0 ⟺ 在 α=0.05 下拒绝 H₀。对于差异的 CI：如果 μ₁-μ₂ 的 95% CI 不包含 0，则双样本检验在 α=0.05 下显著。
>
> **面试最佳实践：** 不只报告"结果是否显著"，同时报告点估计和 95% CI。比如："该策略的月均超额收益为 0.45%，95% CI 为 [-0.20%, 1.10%]，未能排除零效应（p=0.089）。"——这一句话包含了所有关键信息。

#### 为什么 95% 而不是 90% 或 99%？

> 这个问题在面试中也偶尔被问到。95% 置信度是一个"社会契约"——Fisher 早年提出 p<0.05 作为"值得再研究一次"的初步门槛，后来行业逐渐固化为"发表标准"。本质上：90% CI 太窄（犯错率 10% 太高），99% CI 太宽（样本量要求太高，实际中往往做不到）。95% 是中间的一个实用折中。但在某些领域标准不同：物理学发现粒子要求 5-sigma（p ≈ 3×10⁻⁷），而某些社会科学中 p<0.10 也被视为"边际显著"。关键不是死记 α=0.05，而是知道**"α 越小，结论越保守，样本量需求越大"**这个 trade-off。

---

## 第六节：相关性 vs 因果关系 —— 你不能在面试中搞错

> 这是统计推断中最危险的一个陷阱，也是面试中最常被考察的概念区分。如果你在投行/咨询面试中说"数据显示 A 和 B 高度相关，所以 A 导致 B"——面试官大概率已经在心里画了个叉。

### 6.1 伪相关与遗漏变量

> 冰淇淋销量和溺水死亡人数高度正相关（r≈0.8）。所以吃冰淇淋会导致溺水？当然不是。第三个变量——夏天的高温——同时导致更多人吃冰淇淋和更多人游泳（进而更多溺水）。

> 这个"第三个变量"叫做**混淆变量**（Confounding Variable）。遗漏了它，你就会看到 A 和 B 之间本不存在的"因果"假象。这叫**遗漏变量偏误**（Omitted Variable Bias）。

**经典案例 —— MBA 毕业的 CEO 是否带来更好的公司业绩？**

> 数据显示：MBA 毕业的 CEO 领导的公司，平均 ROE 比非 MBA CEO 高 3 个百分点。所以 MBA 教育提升了公司业绩？不一定是因果。可能是：
> - 更好的公司（本身 ROE 就高）更愿意花钱请 MBA CEO（逆向因果）
> - 出身富裕家庭的人更可能读 MBA，同时他们的人脉更有助于拿到好公司的 CEO 职位（遗漏变量）

**伪相关展览馆 —— 数学不撒谎，但也不思考：**

> 美国在科学、空间和技术上的支出，与上吊自杀人数之间的相关性 r = 0.99（1999-2009 年）。德国每人的奶酪消费量，与被床单缠住而死亡的人数之间的相关性 r = 0.95。这些是真实的统计相关性，但显然毫无因果关系——这是"数据挖掘"的必然产物：在几百万对变量中，总会有些纯靠巧合出现高相关。

#### 遗漏变量偏误的 DAG 直觉

> DAG（有向无环图，Directed Acyclic Graph）是经济学家和流行病学家用来形式化因果关系的工具。画法：
>
> 遗漏变量情况：Z → X，Z → Y。如果你只看 X 和 Y 的相关而忽略 Z，你就在测量一条被 Z 污染的假关系。
>
> 正确做法：在面试中，当你被要求解释"为什么 A 和 B 相关"时，永远先问自己："有没有一个 C，它既影响 A 又影响 B？"

#### 一个面试中常见的"因果 vs 相关"辨析题

> "数据显示，喝红酒的人心脏病发病率更低。所以红酒预防心脏病。"——这个论证有什么问题？

> **可能的混杂因素：** 喝红酒的人往往收入更高（红酒比啤酒贵），收入高的人有更好的医疗条件、更健康的饮食、更多的锻炼时间。不是红酒本身有魔力，而是"有钱喝红酒"这个行为与"有钱保持健康"高度相关。法国的"法式悖论"（高饱和脂肪饮食但心脏病发病率低，归功于红酒）后来被发现更大程度上是数据记录方式（法国死亡证明的心脏病分类与美国不同）和饮食整体模式（地中海式饮食的多元蔬菜、橄榄油、鱼）导致的，红酒中的白藜芦醇的效果远没有最初声称的那么大。

> **面试要点：** 永远区分"observational association"和"causal effect"。对于观测数据提出的因果主张，你的第一反应应该是："How would you design an RCT to test this?"——然后再退回来讨论为什么不能用 RCT（伦理、成本、可行性），以及替代方案（DiD、RD、IV 等）。

---

### 6.2 因果推断方法概览

> 既然观测数据里的相关性不能直接解释为因果，社会科学和商业分析就发展了一套专门的"因果推断"工具箱。面试中你能说出这些方法的名字和基本逻辑即可。

#### 随机对照试验（RCT —— Randomized Controlled Trial）

> **黄金标准。** 随机将受试者分为处理组和对照组，唯一的系统差异就是"是否接受处理"。因为分组是随机的，两组在一切可观测和不可观测的变量上都（在期望上）均衡。因此，组间结果的差异可以归因为处理本身。

> **局限性：** 贵，慢，有些情况下不道德（不能让一组人不接受教育来做对照），有些情况下不可行（宏观经济政策不能随机分配给不同国家）。

#### 双重差分（Difference-in-Differences, DiD）

> **简单实例 —— 最低工资对就业的影响：**
>
> 州 A 在 2022 年将最低工资从 $12 提高到 $15。州 B 没有改变（保持 $12）。
>
> 数据：
> - 州 A：2021 年就业率 95%，2023 年就业率 93%（变化 = -2%）
> - 州 B：2021 年就业率 94%，2023 年就业率 93%（变化 = -1%）
>
> DiD = (93%-95%) - (93%-94%) = (-2%) - (-1%) = -1%
>
> 结论：在考虑到全国性趋势（州 B 也下降了 1%）之后，最低工资提高的"净效应"大约是减少 1% 的就业率。这就是双重差分的核心思想：**先差分（before vs after），再差分（treatment vs control）**，把"自然趋势"从"处理效应"中剥离。

#### 断点回归（Regression Discontinuity, RD）

> **概念：** 利用一个任意的分界线来做因果推断。例如：奖学金只发给高考分数 ≥600 的学生。考 599 分的学生和考 600 分的学生，除了是否拿到奖学金外，在能力上几乎完全相同。比较这两个人群的大学成绩——这个差异可以归因为奖学金的效果。
>
> "分界线两侧几乎等同的人群"是 RD 识别因果效应的核心假设。

#### 工具变量（Instrumental Variable, IV）

> 概念层面：找一个变量 Z，它影响 X（处理变量），但不直接影响 Y（结果变量），而且只通过 X 影响 Y。Z 就是一个"工具"。最经典的例子是：用"降雨量"作为"冲突爆发"的工具变量来研究冲突对经济增长的影响——降雨量影响农业产出→影响冲突→但降雨量不直接影响 GDP 增长。

---

## 第七节：经典统计陷阱 —— 面试中绝对不能犯的错

### 7.1 幸存者偏差（Survivorship Bias）

> "二战时，军方检查返航的战斗机，发现机翼上弹孔最多，于是决定加固机翼。"一个统计学家（亚伯拉罕·瓦尔德）指出：不，应该加固弹孔最少的地方（引擎和油箱）——因为被击中那里的飞机根本就没有返航。
>
> 你只能看到"活下来"的样本。活下来的人带有特定的特征（比如机翼上弹孔多）——但这不代表那些特征导致了存活。

#### 数值演示 —— 为什么"好基金"的业绩会高估

> 模拟实验：1000 只基金同时起步，每只基金的年回报独立随机，服从 N(8%, 20%)。每年如果一只基金的累计净值跌到 0.50 以下（"腰斩"），假设清盘退出。运行 10 年。

> 初始：1000 只基金，真实能力均值 = 8%/年。
> 10 年后：约 200 只基金存活（800 只在某个时点跌破 0.50 被清盘）。
> 存活的 200 只基金的平均年化回报：约 12%。
> **但所有 1000 只基金的真实平均年化回报仍然是 8%。**
> 幸存者偏差的效应：你观察到的 12% 比真实的 8% 高出了 4 个百分点——纯粹是因为表现差的基金消失了。

> **面试中的应用：** "我们发现顶级 PE 基金的回报率很高"——这可能是幸存者偏差：回报率差的 PE 基金不再募资，你根本看不到它们。对冲基金数据库（如 HFR）存在著名的"回填偏差"（backfill bias）：基金只有表现好之后才会主动提交数据。

#### 幸存者偏差的另一个经典商业案例

> 某招聘平台统计了平台上自由职业者的收入，报告称"自由职业者平均年收入 25 万，比上班族高 40%"。问题在哪？收入低于某个阈值的自由职业者可能已经退出了平台（回公司上班了），你统计的是"留下来的人"——而留下来的人恰恰是做得还不错的那批。还有，兼职赚外快的上班族可能根本不注册这种平台。

> **面试中怎么用：** 当你在咨询案例中被要求分析一个行业的"平均业绩"时，先问："这个平均数是从哪来的？谁被排除在外了？谁被包括进来了？退出的、失败的、不回答的那些数据在哪？"

---

### 7.2 选择性偏差（Selection Bias）

> 样本不是随机抽取的，而是以一种与结果变量相关的方式被"选入"样本——样本不再代表总体。

> **经典案例：** 通过问卷调查"大学毕业生毕业五年后的平均薪资"。高薪的人更愿意回应调查（骄傲），低薪的人更不愿意回应（羞愧）→ 调查结果有偏。

> **Heckman 校正（概念层面）：** 诺贝尔奖得主 James Heckman 的方法：建立一个两步模型。第一步预测"被观测到的概率"（选择方程），第二步在修正了选择偏误后预测"结果"（结果方程）。实际操作需要专门的计量软件，但面试中能说出这个概念已经足够。

---

### 7.3 辛普森悖论（Simpson's Paradox）

> 分组看，A 每一组都比 B 好；但合起来看，B 总体比 A 好。原因：各组的样本量不同，而且在"更难"的组中 A 有更多样本。

**经典案例 —— 某大学研究生录取中的性别偏倚争议：**

| 学院 | 男性申请数 | 男性录取 | 录取率(男) | 女性申请数 | 女性录取 | 录取率(女) |
|------|-----------|----------|-----------|-----------|----------|-----------|
| 商学院 | 800 | 480 | 60% | 200 | 130 | 65% |
| 法学院 | 200 | 40 | 20% | 800 | 180 | 22.5% |

> **看每个学院：** 商学院的女生录取率 65% > 男 60%。法学院的女生 22.5% > 男 20%。看起来没有性别偏倚，甚至女生还有优势。
>
> **但合并起来看总体：**
> 男总录取率 = (480+40)/(800+200) = 520/1000 = 52%
> 女总录取率 = (130+180)/(200+800) = 310/1000 = 31%
>
> 合并后，男性录取率 52%，女性 31%。悖论的解释：女性更倾向于申请法学院（录取率低），男性更倾向于申请商学院（录取率高）。性别和学院选择之间存在 confounding。

> **商业应用：** 比较两个销售团队的转换率时，A 队总体高，但 B 队在每种客户类型中都高于 A 队——可能因为 A 队的客户 mix 中"容易成交"的类型占比更高。没有做 mix adjustment 之前，A 队的成绩不代表他们的能力更强。

#### 辛普森悖论的第二个商业实例 —— 广告投放渠道比较

> 某电商公司的营销团队比较两种广告渠道的转化率：

| 渠道 | 移动端展示数 | 移动端转化 | 移动转化率 | PC端展示数 | PC端转化 | PC转化率 |
|------|------------|-----------|-----------|-----------|---------|---------|
| 渠道A | 5000 | 500 | 10.0% | 1000 | 50 | 5.0% |
| 渠道B | 1000 | 120 | 12.0% | 5000 | 300 | 6.0% |

> 在每个设备类型上，渠道 B 的转化率都高于渠道 A（移动 12%>10%，PC 6%>5%）。但看总数据：A 总转化率 = (500+50)/(5000+1000) = 550/6000 = 9.17%。B 总转化率 = (120+300)/(1000+5000) = 420/6000 = 7.00%。A 总体更高——为什么？因为 A 的流量中有 83% 在转化率更高的移动端，而 B 只有 17%。渠道和设备类型之间有 confounding。

> **解决方案：** 用标准化/加权平均来校正。以 A 和 B 合在一起的设备 mix 作为权重（移动 60% vs PC 40%）：A 标准化转化率 = 10%×0.6+5%×0.4 = 8.0%。B 标准化转化率 = 12%×0.6+6%×0.4 = 9.6%。校正后，**B 确实更好**。面试中遇到辛普森悖论：先拆分子组看，如果方向反转，就找到"权重差异"在哪个维度；然后用标准化做校正。

---

### 7.4 回归到均值（Regression to the Mean）

> 如果某件事第一次测量时极端地高，第二次测量时它通常会更接近平均值——这不是因为任何机制在起作用，纯粹是统计规律。

**为什么？** 极端值 = 真实能力 + 极端运气。能力是稳定的，但运气不持久。下一次，运气大概率回归到"普通"水平，所以总结果回归到均值。

**基金经理的"年度之星"魔咒：**

> 每年晨星（Morningstar）都会评选"基金经理年度之星"。数据显示：获奖当年的平均超额收益在行业中排前 1%。**获奖后三年的平均超额收益：往往低于行业中位数。** 不是因为他们"骄傲了"或者"能力退化了"——而是因为获奖那年的极端业绩大概率包含了巨大的运气成分。运气不持续，业绩回归均值。

**面试中的应用：** 当听到"某某销售员今年业绩翻了 5 倍，我们明年计划都按这个增速排"——你应该警觉。明年的增速大概率会大幅回落。不是销售员变差了，是"回归到均值"。

---

### 7.5 赌徒谬误（Gambler's Fallacy）

> "这个硬币连续 10 次正面了，下一次反面的概率一定很高。"——错。如果硬币是公平的，每次投掷独立，P(反) 永远是 50%。硬币没有记忆。

> 在投资界："这只股票连续涨了 5 天，明天肯定要回调。"——这是对随机游走的误解。如果价格变化接近随机，昨天涨不意味着今天跌。

#### 均值回归 vs 赌徒谬误 —— 如何区分？

| | 均值回归（是真的） | 赌徒谬误（是错的） |
|--|-------------------|-------------------|
| 机制 | 存在一个稳定的"均值"，偏离后会有一个力把它拉回来 | 独立事件，没有拉回的力 |
| 例子 | P/E 比率：过高时企业盈利跟不上，估值终究回落 | 硬币抛掷：每次独立 |
| 例子 | 运动员的赛季表现：运气均值回归 | 轮盘赌号码：每次独立 |
| 关键问题 | "有一个稳定的长期均值吗？" | "每次事件是否独立？" |

> 如果存在一个基本面锚定的"均衡水平"（如 P/E 的历史均值、利率的长期均衡），超调后回归是有理论依据的。但如果事件独立（如每一次轮盘旋转），"该回来了"只是大脑的模式识别机制在欺骗你。

---

## 面试题一览

> 以下题目涵盖了本周的核心概念。建议不仅看答案，更重要的是一边做一边自言自语——面试中你要把思考过程讲出来。

**题 1：** 某 VC 的历史数据显示，投资的项目中 20% 成功退出。成功退出的公司中，70% 在 A 轮之前就有付费客户。失败的公司中，只有 25% 在 A 轮之前有付费客户。现在面前一个新项目，A 轮之前已经有付费客户。问：这个项目成功退出的概率是多少？

**解题思路：** 贝叶斯定理。设 S=成功退出，C=有付费客户。P(S)=0.20，P(C|S)=0.70，P(C|非S)=0.25，P(非S)=0.80。P(S|C) = (0.70×0.20)/(0.70×0.20+0.25×0.80) = 0.14/(0.14+0.20) = 0.14/0.34 = 41.2%。初始信念 20% → 更新为 41.2%。

---

**题 2：** 某银行新开发了一套 AI 反欺诈系统。历史数据显示交易中欺诈率约为 2%。系统的检出率（抓出真正欺诈）为 95%，误报率（把正常交易标记为欺诈）为 5%。如果一笔交易被系统标记了，它真正是欺诈的概率是多少？

**解题思路：** 另一个贝叶斯定理。F=欺诈，M=被标记。P(F)=0.02，P(M|F)=0.95，P(M|非F)=0.05，P(非F)=0.98。P(F|M) = (0.95×0.02)/(0.95×0.02+0.05×0.98) = 0.019/(0.019+0.049) = 0.019/0.068 = 27.9%。尽管系统看起来不错，但在 2% 的 base rate 下，被标记的交易中只有约 28% 是真正的欺诈。这为什么反欺系统往往依赖多重信号而非单一规则——单规则的阳性预测值不够。

---

**题 3：** 你需要检验一位基金经理是否真的有选股能力。他过去 25 个月的年化超额收益均值为 2.4%，年化波动率（σ）历史经验值为 8%。请以 α=0.05 进行假设检验，并计算 95% 置信区间。

**解题思路：**
- z 检验：H₀：μ=0，H₁：μ>0。n=25，x̄=2.4%，σ=8%。
- z = (2.4-0)/(8/√25) = 2.4/1.6 = 1.50
- 临界值 z_crit(α=0.05,单侧) = 1.645。1.50 < 1.645 → 未能拒绝 H₀。
- p-value = P(Z > 1.50) = 1-0.9332 = 0.0668。
- 95% CI = 2.4% ± 1.96×(8/√25) = 2.4% ± 3.136% = [-0.736%, 5.536%]。CI 包含 0，与检验结论一致。

---

**题 4：** 解释为什么在医学筛查研究中，一个 99% 准确率的诊断测试在人群筛查中阳性预测值可能只有不到 10%。用贝叶斯公式说明。

**解题思路：** 见第二节例 2 的完整计算。核心原因：患病率（base rate）极低 → 假阳性人数（健康但被误报的人）远多于真阳性人数（生病且被正确检出的人）。假阳性淹没了真阳性。

---

**题 5：** 某公司做了 20 个 A/B 测试来优化网站，每个测试使用 α=0.05。他们发现 3 个测试显著，并据此调整了网站设计。这个决策有什么问题？

**解题思路：** 多重比较问题。P(至少 1 个假阳性) = 1-0.95²⁰ = 64.2%。在 20 个测试中，即使所有变化都无效，预期也有 1 个假阳性（20×0.05=1）。找到了 3 个显著结果中，可能只有 2 个是真实效果——但也可能 3 个全是假阳性。应该用 Bonferroni 校正（每个检验用 α=0.0025）或 BH 过程来控制 FDR。

---

**题 6：** 一家公司报告说"团队平均薪资为年薪 15 万"。你了解到团队有 1 位创始人和 19 名员工。你不信任这个均值。应该问什么？用哪些统计度量？

**解题思路：** 如果是严重右偏的薪资分布（创始人高额薪酬），均值会被拉高。应该问中位数、分位数（25th, 75th percentile）、或者修剪均值（去掉上下 5%）——这些比均值更能反映"普通员工挣多少"。如果对方不提供这些，可以要原始数据自己算分布形状（直方图、偏度）。如果创始人 300 万，19 个员工都是 6 万，均值 = (300+19×6)/20 = 20.7 万，但中位数 = 6 万。只报告均值是 misleading。

---

**题 7：** 一个投资策略过去 10 年的年化回报为 15%，而市场（S&P 500）同期回报为 10%。策略的回报标准差为 25%，市场回报标准差为 15%。相关性为 0.8。你如何判断这个策略的超额收益是否显著？

**解题思路：** 直接比较 15% vs 10% 忽略了一个关键问题：策略可能只是加了更高的杠杆或承担了更多的系统性风险。CAPM 框架下：Beta = ρ × (σ_strategy/σ_market) = 0.8 × (25%/15%) = 0.8 × 1.667 = 1.333。Beta 为 1.33 的策略，在市场涨 10%（假设 Rf≈0%）时自然会涨 13.3%——多出来的 1.7%（=15%-13.3%）才是"异常"超额收益（Alpha）。然后对这个 Alpha 做 t 检验（需要标准误数据），判断是否显著不等于 0。面试要点：**不能说"15%>10%所以好"，必须说"控制 Beta 之后的 Alpha 是多少"。**

---

**题 8：** 在面试中，面试官给你下面这张表，问你看到了什么：

| 组别 | 人数 | 平均分 |
|------|------|--------|
| 整体 | 200 | 75.0 |
| 男生 | 100 | 78.0 |
| 女生 | 100 | 72.0 |

> 面试官说："男生成绩显著高于女生，差了 6 分。你觉得这合理吗？"

**解题思路：** 这里面缺少两个关键信息：一是分数的标准差（或标准误）——没有标准误就无法做假设检验；差值 6 分在没有标准差的情况下无法判断是否"显著"。二是可能存在遗漏变量——也许男生更多选了理科课程（评分较松），女生更多选了文科课程（评分较严），如果你按课程分别分析，方向可能反转（辛普森悖论）。正确回答："我需要知道各组的标准差来判断这 6 分的差异是否统计显著。另外，在我们下结论之前，我想按课程或专业分拆数据，排除潜在的混淆变量。如果能做 t 检验，我会报告 t 统计量、p 值、以及均值差的 95% 置信区间。"

---

## 回顾：Day 14 核心要点速查

> 明天进入 Day 15 之前，请确保你能轻松回答以下问题。它们是你构建量化思维的底层词汇。

| 概念 | 一句话 |
|------|--------|
| 中位数 vs 均值 | 右偏分布用中位数，不要被极端值骗了 |
| 几何平均 vs 算术平均 | 复合增长（乘法过程）用几何平均，不要用算术平均算复利 |
| 标准差 | 平均到每个数据点离中心的典型距离 |
| 贝叶斯定理 | Prior x Likelihood = Posterior；有证据之后更新信念 |
| p 值 | 在 H₀ 为真的前提下，数据看起来有多极端；p 值不是 H₀ 为真的概率 |
| 95% 置信区间 | 如果重复实验很多次，95% 的区间会包含真值 |
| 第一类错误 | 错杀好人——拒绝了真的零假设（你控制了它的概率 = α） |
| 多重比较 | 检验越多，假阳性越多；Bonferroni 或 BH 必须校正 |
| 肥尾 | 金融市场极端事件比正态分布预测的多得多 |
| 幸存者偏差 | 只看活着的，活着的看起来都特别强 |
| 辛普森悖论 | 每组都是 A 赢，合起来 B 赢——因为权重不同 |
| 回归到均值 | 极端表现下次会回来一些——运气不持续 |
| 赌徒谬误 | 独立事件没有"该回来了"——硬币没有记忆 |
| 伪相关 | 两个变量高度相关不等于有因果关系——先找第三个变量 |

> Day 14 的所有概率、分布、检验——就是明天建模型的积木。在进入回归分析之前，问自己两个问题：**我已经能用贝叶斯更新信念了吗？我已经能用 t 检验判断"差异是否显著"了吗？** 如果答案是 yes，明天的路就好走多了。如果还有模糊的地方，回到对应的小节，把数字代入手工算一遍——统计不是"看会的"，是"算会的"。

---

## 明日预告：Day 15 —— 建模与量化决策

> 今天你学会了怎么描述数据、怎么推断结论、怎么量化不确定性。明天我们将进入"建模"的世界——用数学函数把变量之间的关系写成方程式，然后用数据去"拟合"出最优参数。

**Day 15 核心模块预览：**

- **线性回归：** 把相关系数升级为"因果关系引擎"——Y = β₀ + β₁X + ε，β₁ 的 t 检验（今天学的！）告诉你 X 是否显著影响 Y
- **多元回归：** 同时控制多个变量，"在控制其他因素不变的前提下，X₁ 增加一单位，Y 变化多少"
- **Logistic 回归：** 当 Y 是 0/1 二值变量时（如违约/不违约、购买/不购买），把概率建模
- **ANOVA：** 比较三个或更多组的均值是否有差异——t 检验（今天学的！）的推广版
- **因素分析与聚类：** 降维和分组——"这 50 个变量背后本质上是哪 3-4 个因子？"、"这几百个客户可以分几类？"
- **蒙特卡洛模拟：** 面对复杂系统（比如一个投资项目有三种不确定性来源，互相影响），用随机抽样模拟 10000 种"可能的未来"，看分布

> 如果你今天还没完全掌握 p 值和 t 检验，明天在理解"回归系数是否显著"时会遇到困难——因为这些完全依赖今天的内容。花 15 分钟翻回第四节再看一遍，值得。

---

*Day 14 · 概率统计与推断基础 · 2026-08-12*

> **自检清单（明天上课前完成）：** □ 我能手工算贝叶斯公式的三个例题吗？ □ 我能区分单侧和双侧 z 检验并说出临界值吗？ □ 我能解释为什么 p 值不是"H₀ 为真的概率"吗？ □ 我能至少说出两个伪相关例子吗？ □ 我能用"幸存者偏差"和"辛普森悖论"来分析一篇商业报告吗？ 如果五个都打勾，你已经准备好了。明天见。
