Skip to content

📘 Day 14 · 概率统计与推断基础

📖 本章学习目标:掌握描述性统计、概率论、贝叶斯定理、概率分布、假设检验和置信区间——学完能用统计推断的语言描述"我知道什么、我有多确定"。


Day 14: 概率统计与推断基础 — 用数据做判断的底层数学

学习目标: 从"凭感觉"升级到"凭数据"。今天结束之后,你应该能用贝叶斯定理从先验概率推算后验概率,能手工完成一个 t 检验并给出结论,能一眼识破别人图表和报告中的统计陷阱(幸存者偏差、辛普森悖论、伪相关)。统计不是算数,是思维方式。

核心问题: 面对不确定性时,怎么用概率和统计的语言描述"我知道什么、我不知道什么、我有多大把握"?

为什么是两天: 量化思维内容太多,拆为两天。今天聚焦"描述数据 + 推断结论"(概率论、贝叶斯、假设检验、置信区间),明天聚焦"建立模型 + 做出决策"(回归、ANOVA、因素分析、聚类、蒙特卡洛)。

与明天的关系: 今天所有内容(概率、分布、检验)是明天所有模型(回归、ANOVA、聚类)的数学基础——如果今天没搞懂 p 值,明天的回归系数显著性检验就听不懂。


第一节:描述性统计 —— "平均"这个词骗了你多少次

老板说"我们团队平均薪资 6.5 万",你觉得还不错。进去之后发现:9 个人拿 3.5-5.5 万,老板自己拿 300 万。"平均数"在数学上是诚实的,但你的直觉不一定是。描述性统计存在的全部意义,就是用一个或几个数字,把成千上万个数据点的"形状"讲清楚。问题在于:你选的数字对不对?

1.1 均值、中位数、众数 —— 三个"平均",三种故事

一个数据集的"中心"在哪里?三种答案,各有各的用途,也各有各的坑。

算术平均数(Mean)

最常用的"平均值":把所有数加起来,除以个数。

公式: μ(总体均值)= (Σxᵢ)/N 或 x̄(样本均值)= (Σxᵢ)/n

手工计算:团队薪资

岗位月薪(万元)
实习3.5
助理3.8
专员4.0
主管4.2
经理4.4
高级经理4.5
副总监4.7
总监5.0
副总裁5.5
老板30.0

计算过程:3.5+3.8+4.0+4.2+4.4+4.5+4.7+5.0+5.5+30.0 = 69.6。n=10。均值 = 69.6/10 = 6.96 万元。老板说"平均 6.96 万",数学上没毛病。但 9 个人收入都在 5.5 万以下。这个均值被一个极端值严重拉高了。

加权平均数(Weighted Mean)

当不同观测有不同的重要性时,用加权平均。

投资组合回报案例: 你有 100 万,30% 投股票 A(年回报 12%),70% 投股票 B(年回报 7%)。组合的加权平均回报是多少?

w_A = 0.30,r_A = 12%;w_B = 0.70,r_B = 7%。加权均值 = 0.30×12% + 0.70×7% = 3.6% + 4.9% = 8.5%。这不是简单的 (12+7)/2 = 9.5% —— 后者假设等权重,但实际你的资金分配不是等权重的。

几何平均数(Geometric Mean)

算术平均会夸大复合增长的回报。几何平均是"复合增长率"的正确度量。

公式: G = (x₁ × x₂ × ... × xₙ)^(1/n),或等价地:ln G = (1/n) × Σ ln(xᵢ)

投资回报案例: 某基金经理的三年回报分别是 +50%、-30%、+20%。算术平均 = (50-30+20)/3 = 13.3%。但你的钱实际上是怎么变的?

本金 100 万 → 第一年:100×(1+50%) = 150 → 第二年:150×(1-30%) = 105 → 第三年:105×(1+20%) = 126。从 100 到 126,三年总共增长 26%。年化复合增长率 = (126/100)^(1/3) - 1 = 1.26^(1/3) - 1 ≈ 8.0%。用几何平均公式:(1.50×0.70×1.20)^(1/3) = (1.26)^(1/3) = 1.080 → 几何平均回报 = 8.0%。

为什么几何平均是对的? 因为投资回报是乘法过程(compound),不是加法过程。几何平均 = 8.0%,不是 13.3%。下次看到基金宣传"算术平均年化回报 13.3%",你得看看他们是不是用错了平均数。

修剪均值(Trimmed Mean)

去掉极端值再算均值——体育比赛打分常用的"去掉一个最高分,去掉一个最低分"就是 10% 修剪均值。

团队薪资例子:去掉最低(3.5)和最高(30.0),计算剩余 8 个数:3.8+4.0+4.2+4.4+4.5+4.7+5.0+5.5 = 36.1。修剪均值 = 36.1/8 = 4.5125 万 —— 这才更接近"普通员工挣多少"。

中位数(Median)

把所有数按大小排列,正中间的那个就是中位数。奇数个就是中间那个;偶数个就是中间两个的平均值。

团队薪资(已排序):3.5, 3.8, 4.0, 4.2, 4.4, 4.5, 4.7, 5.0, 5.5, 30.0。n=10(偶数),取第 5 和第 6 个:4.4 和 4.5。中位数 = (4.4+4.5)/2 = 4.45 万元。

中位数 4.45 万,均值 6.96 万——差了一半还多。中位数告诉你的信息更真实:"一半人拿不到 4.45 万,一半人超过 4.45 万。"

众数(Mode)

出现频率最高的值。团队薪资这个例子没有重复值(每个岗位不同),所以没有众数。但在消费者偏好调查中非常有用:500 个人,165 人选品牌 A,110 人选品牌 B——品牌 A 就是众数。

三个度量的使用场景:

场景用什么原因
收入/房价分布中位数严重右偏,均值被拉高
投资组合回报几何平均复合增长是乘法过程
次品率/合格率算术均值服从正态分布,无极端值
不同权重的考核加权平均各指标重要程度不同
消费者偏好众数关心"最常见的偏好是什么"

均值 vs 中位数:一个更极端的例子,帮你建立直觉

某 VC 基金投了 50 个项目。49 个归零了(回报 = -100%),1 个投中了独角兽,回报 = 10,000%(100 倍)。算术平均回报 = (49×(-100%) + 1×10000%)/50 = (-4900%+10000%)/50 = 5100%/50 = 102%。VC 基金宣传"我们的平均回报是 102%"——这在数学上正确,但在现实中是对实情的严重扭曲。中位数 = -100%(第 25 和第 26 个项目都是 -100%)。真相:你投的这个基金,中位数回报是 -100%。 大多数 LP 血本无归,只有一个 LP 暴富——"平均"把两个世界的事混在一起了。

标准差的实际单位解读

前面算出来的股票 A 的 s = 0.144%。这到底意味着什么?如果日回报大约是正态分布的(这是个假设),那么大约 95% 的交易日回报在 x̄ ± 2s = 0.02% ± 2×0.144% = [-0.268%, 0.308%] 的区间内。换句话说,正常交易日这只股票跌不过 0.3%,涨不过 0.3%——按这个标准来看,一旦某天它跌了 1%,就至少是 7 个标准差的事件了,极为异常,值得查查新闻出了什么事。


1.2 方差、标准差与变异系数

均值告诉你"中心在哪",方差告诉你"散得多开"。两只股票平均日回报都是 0.05%,但一只每天在 -2% 到 +2% 之间波动,另一只在 -0.5% 到 +0.6% 之间——你显然更想知道这个差别。

方差(Variance)的手工计算

公式:

  • 总体方差:σ² = Σ(xᵢ - μ)² / N
  • 样本方差:s² = Σ(xᵢ - x̄)² / (n-1)

完整手工计算 —— 两只股票 5 日回报对比:

股票 A:日回报(%)= 0.05, -0.10, 0.20, -0.15, 0.10 股票 B:日回报(%)= 0.02, 0.01, 0.04, -0.01, 0.03

股票 A 的方差计算:

回报 xᵢxᵢ-x̄(xᵢ-x̄)²
10.050.05-0.02=0.030.0009
2-0.10-0.10-0.02=-0.120.0144
30.200.20-0.02=0.180.0324
4-0.15-0.15-0.02=-0.170.0289
50.100.10-0.02=0.080.0064

先算均值:x̄_A = (0.05-0.10+0.20-0.15+0.10)/5 = 0.10/5 = 0.02%。s²_A = Σ(xᵢ-x̄)²/(n-1) = (0.0009+0.0144+0.0324+0.0289+0.0064)/4 = 0.0830/4 = 0.02075。标准差 s_A = √0.02075 ≈ 0.144 ≈ 0.144%。

股票 B 的方差计算:

回报 xᵢxᵢ-x̄(xᵢ-x̄)²
10.020.02-0.018=0.0020.000004
20.010.01-0.018=-0.0080.000064
30.040.04-0.018=0.0220.000484
4-0.01-0.01-0.018=-0.0280.000784
50.030.03-0.018=0.0120.000144

x̄_B = (0.02+0.01+0.04-0.01+0.03)/5 = 0.09/5 = 0.018%。s²_B = (0.000004+0.000064+0.000484+0.000784+0.000144)/4 = 0.001480/4 = 0.00037。s_B = √0.00037 ≈ 0.0192%。

结论: 两只股票日均回报差不多(0.02% vs 0.018%),但 A 的波动(σ≈0.144%)是 B(σ≈0.019%)的约 7.5 倍。股票 A 是"过山车型",股票 B 是"慢走型"。方差把这种差异量化了。

为什么分母是 n-1?(贝塞尔校正 Bessel's Correction)

这不是"数学家故意把题目变难"。当你用样本均值 x̄ 代替总体均值 μ 时,你已经用掉了一个"自由度"——你算出来的 x̄ 本身就离各个数据比 μ 离各个数据更近(因为 x̄ 就是最小化 ∑(xᵢ-c)² 的那个 c)。所以用 n-1 补偿这种"偏小"的偏差。

直觉理解: 如果只抽 1 个数据,n=1,你能算出均值(就是那个数本身),但你能说出"数据散得多开"吗?不能。用 n,方差 = (x₁-x₁)²/1 = 0——这是胡说八道。用 n-1,分母 = 0,方差 = 未定义——这才诚实。

变异系数(Coefficient of Variation, CV)

问题:某股票日波动 σ=0.5%,另一个市场债券日波动 σ=0.05%。但股票日均回报 0.2%,债券日均回报 0.01%。"波动"谁更大?

σ 除以 μ:CV = σ/μ。CV_A = 0.5/0.2 = 2.5。CV_B = 0.05/0.01 = 5.0。债券的"每单位回报承担的波动"反而比股票大。CV 让你比较不同量级的东西——就像你不能因为大象吃得比老鼠多就说大象"更胖",你要看饭量/体重比。

工作量实例:百威亚太(1876.HK)季度收入波动

以下是 8 个季度的收入数据(亿元,模拟数据):

季度Q1Q2Q3Q4Q5Q6Q7Q8
收入16.218.519.817.115.819.220.517.9

均值 x̄ = (16.2+18.5+19.8+17.1+15.8+19.2+20.5+17.9)/8 = 145.0/8 = 18.125 亿元

离差平方和:Σ(xᵢ-18.125)² = (16.2-18.125)² + (18.5-18.125)² + (19.8-18.125)² + (17.1-18.125)² + (15.8-18.125)² + (19.2-18.125)² + (20.5-18.125)² + (17.9-18.125)² = (-1.925)² + 0.375² + 1.675² + (-1.025)² + (-2.325)² + 1.075² + 2.375² + (-0.225)² = 3.706 + 0.141 + 2.806 + 1.051 + 5.406 + 1.156 + 5.641 + 0.051 = 19.958

样本标准差 s = √[19.958/(8-1)] = √2.851 = 1.689 亿元。CV = s/x̄ = 1.689/18.125 = 9.32%。作为参考,快消品行业季度收入 CV 通常在 5%-15% 之间,9.32% 属于正常波动。

滚动标准差(Rolling Standard Deviation)——彭博终端怎么算"近期波动率"

固定一个窗口(比如 20 个交易日),每次窗口向前移动一天,重新计算这 20 天的标准差。今天算的是"过去 20 天的波动",明天算的就是明天那 20 天的波动。彭博上看到的 20 天历史波动率(20-day Historical Volatility)就是这么来的。


1.3 偏度与峰度 —— 分布的形状,不只是均值和方差

均值和方差告诉你的只是"位置"和"宽度"。但两个分布可以有完全相同的均值和方差,形状却截然不同。

偏度(Skewness)

偏度描述分布是否对称。负偏(左偏):大部分值偏高,少数极端低值拖出一条"左尾巴"——像股价日回报,大部分日子涨涨跌跌幅度不大,但偶尔崩盘那天跌 10%。正偏(右偏):大部分值偏低,少数极端高值拖出一条"右尾巴"——像初创公司退出估值,大部分 0-1000 万,极少数独角兽是几十亿。

手工判断偏度方向(小数据集):

两组数据,每组 5 个数: 数据集 A:2, 3, 4, 5, 36 → 少数极端大值 → 正偏(右偏) 数据集 B:-25, 3, 4, 5, 6 → 少数极端小值 → 负偏(左偏)

快速判断法:均值 > 中位数 → 右偏(被大值拉上去)。均值 < 中位数 → 左偏(被小值拉下去)。均值 ≈ 中位数 → 近似对称。

数据集 A:均值 = (2+3+4+5+36)/5 = 10,中位数 = 4。均值 10 >> 中位数 4 → 右偏。 数据集 B:均值 = (-25+3+4+5+6)/5 = -1.4,中位数 = 4。均值 -1.4 << 中位数 4 → 左偏。

面试提示: 投行/PE 面试中,"看分布先看 skewness"是个加分的回答。基金回报数据往往是负偏的(小赢 + 偶尔大亏),初创企业估值往往是正偏的(大部分失败,少数大赢)。

偏度数值的粗略判断

偏度公式(样本):Skew = [n/(n-1)(n-2)] × Σ[(xᵢ-x̄)/s]³。但面试中你不会被要求算这个。你需要的是判断方向大致量级。规则:

  • |Skew| < 0.5:近似对称
  • 0.5 ≤ |Skew| < 1:中等偏斜
  • |Skew| ≥ 1:高度偏斜
  • 实际金融数据中,日回报的偏度通常在 -0.5 到 0 之间(轻微负偏),而 PE/VC 投资回报的偏度可以高达 3-5(极端正偏)。

偏度在商业中的实战意义

两只股票的日均回报都是 0.05%,标准差都是 1.5%。从均值+方差的角度看,它们完全一样。但股票 A 是负偏(small frequent gains, occasional large crashes),股票 B 是正偏(small frequent losses, occasional large spikes)。哪只更危险?

如果你是做空波动率的策略(卖出期权,赚权利金),你极度讨厌负偏——一次 crash 就会爆仓。如果你是 VC 投资人,你的组合天然正偏——你需要偶尔的正偏事件(独角兽)来弥补大量失败项目。不同商业模式对偏度的偏好完全相反。面试中被问到"除了均值和方差你还看什么",偏度就是你要说的那第三个维度。

峰度(Kurtosis)

峰度描述的是"尾巴有多肥"——极端事件发生的频率有多高。不是说"分布尖不尖",而是说"离均值 4 个标准差之外的概率有多大"。

正态分布的峰度 = 3(或超额峰度 = 0)。超额峰度 = 实际峰度 - 3。超额峰度 > 0 —— "肥尾"——极端事件发生的概率比正态分布预测的要高得多。

为什么金融数据不服从正态分布? 因为金融市场有肥尾。标准普尔 500 日回报的样本峰度在 5-10 之间(超额峰度 2-7)。这意味着"黑色星期一"、"雷曼兄弟"这种事件在正态分布中概率是"千万年一遇",但现实中它们每几年到几十年就发生一次。


1.4 相关系数 —— 两个变量"一起动"的程度

广告投得越多,销量越高?利率越低,房价越涨?——这些"关系"需要一个数字来量化:"到底有多相关?"Pearson 相关系数 r 就是答案。r 在 -1 到 +1 之间:+1 完美正相关,-1 完美负相关,0 毫无线性关系。

Pearson r 的手工计算

公式: r = Σ(xᵢ-x̄)(yᵢ-ȳ) / √[Σ(xᵢ-x̄)² × Σ(yᵢ-ȳ)²]

5 个月广告支出 vs 收入数据:

月份广告支出 X(万元)收入 Y(万元)
110120
215150
312135
418175
520190

完整计算步骤:

Step 1: 计算均值。x̄ = (10+15+12+18+20)/5 = 75/5 = 15。ȳ = (120+150+135+175+190)/5 = 770/5 = 154。

Step 2: 计算离差及交叉乘积。

XYX-x̄Y-ȳ(X-x̄)(Y-ȳ)(X-x̄)²(Y-ȳ)²
110120-5-34170251156
2151500-40016
312135-3-19579361
418175321639441
520190536180251296

Step 3: 求和。Σ(X-x̄)(Y-ȳ) = 170+0+57+63+180 = 470。Σ(X-x̄)² = 25+0+9+9+25 = 68。Σ(Y-ȳ)² = 1156+16+361+441+1296 = 3270。

Step 4: 代入公式。r = 470 / √(68×3270) = 470 / √222360 = 470 / 471.55 = 0.997。

解释: r = 0.997,几乎完美正相关。每多花一元广告,收入似乎就有响应。但注意——相关性不等于因果关系,我们将在第六节展开这个问题。

r 的解读标准

r 绝对值相关强度含义
0.0 - 0.3可能只是噪音
0.3 - 0.7中等有关系,但不足以做确定预测
0.7 - 1.0很强的线性关系

r² —— "解释了多少比例的方差"

r = 0.8 听起来不错,但它的"解释力"只有 r² = 0.64 = 64%。意思是:Y 的总波动中,有 64% 可以被 X 的波动"解释",剩下 36% 是 X 没说明白的东西(可能是其他变量,也可能是随机噪音)。

在我们的例子中,r = 0.997,r² = 0.994。广告支出可以解释 99.4% 的收入波动——这个数据太完美了,现实中几乎不会出现(如果出现,可能是作假了,或者二者根本不是"因果"关系,而是一个共同因子在驱动)。

相关矩阵 —— 4 只股票的相关矩阵

假设我们有 4 只啤酒行业股票:百威亚太(BUD)、青岛啤酒(TSI)、华润啤酒(CRB)、朝日啤酒(ASB)的日回报相关系数矩阵:

BUDTSICRBASB
BUD1.000.720.680.45
TSI0.721.000.850.38
CRB0.680.851.000.40
ASB0.450.380.401.00

解读:

  • 对角线全是 1.00(每只股票和自己的相关系数当然为 1)。
  • 矩阵是对称的(BUD 与 TSI 的相关 = TSI 与 BUD 的相关 = 0.72)。
  • 青岛啤酒和华润啤酒 r=0.85→高度相关(同在 A 股/港股市场,受相同的中国市场政策影响)。
  • 朝日啤酒与另外三只只在 0.38-0.45(日本市场+日元的独立驱动因素)。
  • 投资组合意义:如果你已经持有青岛和华润,再加华润分散效果有限。买点朝日则可能提供更好的分散化。

相关系数的三个重要局限 —— 面试中可能被追问

1. 只测度线性关系。 r 衡量的是"线性相关"的程度,不是任何形式的关联。y = x² 是完美确定的抛物线关系,但 Pearson r ≈ 0。面试中如果有人说"r=0 所以二者无关",你应该纠正:"r=0 只说明没有线性关系,可能存在强烈的非线性关系。"

2. 对异常值极度敏感。 回到我们的 5 个月广告支出例子,如果把第 5 个月的数据从 (20, 190) 改成 (20, 90)——收入从 190 暴跌到 90——r 会从 0.997 暴跌到约 -0.02。一个异常值就能毁掉一个相关性。这就是为什么 EDA(探索性数据分析)中散点图是必画的——你一眼就能看出那个偏离的点。

3. 相关的传导链。 即使 r 是真实的(不是伪相关),相关性本身也不告诉你方向。是 X→Y,还是 Y→X,还是 Z→X 且 Z→Y?第六节将展开这个问题——这是"相关不等于因果"的核心。


第二节:概率论基础 —— 从"我觉得"到"概率是 X%"

概率论不是教你赌钱,而是给你一套应对不确定性的语言。"明天股市涨不涨?""这个项目能不能回本?""这个应聘者能不能胜任?"——你不能确定,但你可以量化。

2.1 概率公理与基本运算

三大公理:

  1. 非负性: 任何事件的概率 ≥ 0。P(A) ≥ 0。
  2. 规范性: 必然事件的概率 = 1。P(Ω) = 1。
  3. 可加性: 如果 A 和 B 互斥(不能同时发生),则 P(A 或 B) = P(A) + P(B)。

补集规则: P(非 A) = 1 - P(A)。百威亚太在某个季度 EPS 不达预期的概率是 35%,则达预期的概率 = 1-0.35 = 65%。

加法规则(通用): P(A 或 B) = P(A) + P(B) - P(A 且 B)

为什么要减?因为如果 A 和 B 有重合,你数了两次。

手工实例 —— 筛选啤酒公司:

研究部跟踪了 200 家全球啤酒公司。定义:

  • A = ROE 超过 15%:P(A) = 0.30(60 家)
  • B = 年收入超过 100 亿元:P(B) = 0.25(50 家)
  • A 且 B(同时满足):P(A∩B) = 0.10(20 家)

问:随机选一家,P(ROE>15% 或 收入>100亿)? P(A∪B) = 0.30 + 0.25 - 0.10 = 0.45 = 45%。

画个 Venn 图:左右两个圈交叠。左边圈 30%,右边圈 25%,交叠部分 10%。把左边圈和右边圈加起来时,交叠部分被数了两次,所以减掉一次。


2.2 条件概率 —— "在已知 X 的情况下,Y 的概率是多少"

条件概率是概率论最重要的概念,没有之一。它回答:"当我掌握了新信息之后,概率怎么变?"贝叶斯定理(2.4 节)不过是这块的更系统化版本。

定义: P(A|B) = P(A∩B) / P(B)

读作:"在 B 已经发生的条件下,A 发生的概率"。

完整手工案例 —— 2×2 列联表:

某 PE 基金跟踪了 250 笔历史投资:

经济上行经济下行合计
投资成功12030150
投资失败4060100
合计16090250

无条件的成功概率(你不知道任何宏观经济信息):P(成功) = 150/250 = 0.60 = 60%。

条件概率 —— 已知经济上行: P(成功∣上行) = 120/160 = 0.75 = 75%。 计算:P(成功∩上行) = 120/250 = 0.48。P(上行) = 160/250 = 0.64。P(成功∣上行) = 0.48/0.64 = 0.75。

条件概率 —— 已知经济下行: P(成功∣下行) = 30/90 = 0.333 = 33.3%。

核心洞察: P(成功∣上行) = 75% ≠ P(成功) = 60% ≠ P(成功∣下行) = 33.3%。宏观经济状况显著影响着投资成功的概率。如果一个变量已知之后概率不变(P(A|B) = P(A)),那 A 和 B 就是独立的。这里的投资成功和宏观经济不是独立的——这是常识,但我们现在有了数学证明。


2.3 全概率公式 —— "分情况讨论,再加权求和"

很多时候你不能直接算 P(B),但你可以"分类讨论":如果 A₁ 发生,P(B|A₁) 是多少;如果 A₂ 发生,P(B|A₂) 是多少……然后按 A₁、A₂……自身的概率加权求和。

公式: P(B) = P(B|A₁)·P(A₁) + P(B|A₂)·P(A₂) + ... + P(B|Aₙ)·P(Aₙ)

其中 A₁, A₂, ..., Aₙ 是一组互斥且穷尽的分割(partition)。

完整手工案例 —— 三家工厂的次品率:

某消费品公司有三个代工厂。工厂 1 承担 40% 的产量,历史次品率 2%。工厂 2 承担 35% 的产量,历史次品率 3%。工厂 3 承担 25% 的产量,历史次品率 1%。请问:随机从仓库抽一件产品,它是次品的概率是多少?

拆解:

  • P(来自工厂1) = 0.40,P(次品∣工厂1) = 0.02
  • P(来自工厂2) = 0.35,P(次品∣工厂2) = 0.03
  • P(来自工厂3) = 0.25,P(次品∣工厂3) = 0.01

全概率公式: P(次品) = 0.02×0.40 + 0.03×0.35 + 0.01×0.25 = 0.008 + 0.0105 + 0.0025 = 0.021 = 2.1%

直觉检验: 三家工厂的次品率分别在 1%-3%,产量占比加权后 2.1% 落在范围内且偏低于中间值(因为最低次品率的工厂 3 有 25% 的权重,不算小),合理。


2.4 贝叶斯定理 —— "更新信念"的数学引擎

这是整个 Day 14 最重要的一节。贝叶斯定理告诉你:拿到新证据之后,你应该怎么从"先验信念"(Prior)更新到"后验信念"(Posterior)。面试中如果被你用贝叶斯框架分析问题,基本就是满分答案的节奏。

公式: P(A|B) = [P(B|A) × P(A)] / P(B)

其中分母 P(B) 可以用全概率公式计算:P(B) = P(B|A)·P(A) + P(B|非A)·P(非A)

直观理解: 后验概率 = (似然度 × 先验概率) / 证据的总概率。你有一个初始信念(Prior),你看到了新数据(Evidence),你更新你的信念(Posterior)。


例 1:VC 投资 —— 看到了"连续创业者"这个信号

场景: 你是一家 VC 的分析师。经验告诉你,投过的创业公司中大约 15% 最终成功退出。你知道一个规律:成功退出的公司中 60% 的创始人之前有过创业经历(连续创业者);而失败的公司中只有 20% 的创始人是连续创业者。现在面前有一个新项目,创始人是连续创业者。问:这个项目成功的概率是多少?

定义事件:

  • S = 成功退出,P(S) = 0.15(Prior)
  • C = 连续创业者
  • P(C|S) = 0.60(成功公司中有 60% 是连续创业者)
  • P(C|非S) = 0.20(失败公司中有 20% 是连续创业者)
  • P(非S) = 1 - 0.15 = 0.85

贝叶斯计算: P(S|C) = [P(C|S) × P(S)] / [P(C|S) × P(S) + P(C|非S) × P(非S)] = [0.60 × 0.15] / [0.60 × 0.15 + 0.20 × 0.85] = 0.09 / [0.09 + 0.17] = 0.09 / 0.26 = 0.3462 = 34.6%

解读: 看到"连续创业者"这个信号之后,你的成功概率从 15% 提高到 34.6%——翻了超过一倍。但仍然只有三分之一左右的成功率。这件事本质上还是很难的,一个信号不能把不确定性变为确定性。贝叶斯告诉你:相信证据,但不要过度反应。


例 2:医学检测 —— 为什么 99% 准确的检测也只意味着 9% 的得病概率

这是统计教育中最经典的例子,面试中经常出现。

场景: 某种罕见病在总人口中的患病率是 0.1%(千分之一,一万人中 10 个)。有一种检测方法:灵敏度 = 99%(真生病的人,检测出来是阳性的概率 = 99%),特异性 = 99%(没生病的人,检测出来是阴性的概率 = 99%,也就是说假阳性率 = 1%)。你做了一次筛查,结果是阳性。问:你真正生病的概率是多少?

直觉陷阱: 99% 准确 →"我 99% 生病了"——大错特错。

定义事件:

  • D = 真正生病,P(D) = 0.001
    • = 检测阳性
  • P(+|D) = 0.99(灵敏度)
  • P(+|非D) = 0.01(假阳性率,因为特异性 99%)
  • P(非D) = 0.999

贝叶斯计算: P(D|+) = [P(+|D) × P(D)] / [P(+|D) × P(D) + P(+|非D) × P(非D)] = [0.99 × 0.001] / [0.99 × 0.001 + 0.01 × 0.999] = 0.00099 / [0.00099 + 0.00999] = 0.00099 / 0.01098 = 0.0902 = 9.0%

震撼结论: 尽管检测 99% 准确,但在阳性结果中,只有约 9% 的人真正生病。为什么?因为疾病太罕见了——每 1000 个人中有 1 个人生病(真阳性约 1 个),但有约 10 个人被误报为阳性(假阳性 = 1% × 999 ≈ 10)。所以在 11 个阳性结果中,只有 1 个是真的。

商业启示: 这就是为什么大规模无差别筛查常常被质疑——当 base rate 很低时,即使测试准确率很高,阳性预测值(Positive Predictive Value)也可能很低。同样的逻辑适用于:招聘筛选、反欺诈系统、信用评分、尽职调查信号——如果 base rate 很低,一个"看起来异常"的信号并不意味着你真的找到了问题。


例 3:信用风险 —— 低信用评分的借款人,违约概率是多少

场景: 银行的历史数据显示,所有贷款申请人中有 5% 最终违约。已知:违约的人中有 80% 的信用评分低于 600;不违约的人中只有 15% 的信用评分低于 600。现在有一个申请人信用评分低于 600。他的违约概率是多少?

定义事件:

  • D = 违约,P(D) = 0.05
  • L = 信用评分低于 600
  • P(L|D) = 0.80
  • P(L|非D) = 0.15
  • P(非D) = 0.95

贝叶斯计算: P(D|L) = [0.80 × 0.05] / [0.80 × 0.05 + 0.15 × 0.95] = 0.04 / [0.04 + 0.1425] = 0.04 / 0.1825 = 0.2192 = 21.9%

解读: 低信用评分将违约概率从 5% 提升到约 22%——显著提高,但远不到确定性。银行不会因为这一个人就拒绝所有低信用评分的申请人,但定价(利率)必须反应这个风险。这就是信用评分模型的底层逻辑。


第三节:概率分布 —— 描述"随机性"的数学语言

前面我们讲了怎么描述已经发生的数据(描述性统计)和概率怎么运算。现在的问题是:如果一个过程是随机的,结果出现的模式是什么样的?——这就是概率分布。

3.1 随机变量 —— 离散 vs 连续

一个随机变量就是一个结果不确定的数值变量。扔骰子之前,我不知道会出现 1 到 6 中的哪一个——但我知道每种结果的可能性。

离散随机变量: 只能取特定的、可数的值。例子:

  • 今年完成的 M&A 交易数量:0, 1, 2, 3, ...
  • 一个季度内收到违约通知的公司数
  • 一次面试中答对的题目数

离散随机变量的概率用 PMF(Probability Mass Function,概率质量函数)描述。P(X=k) 是一个具体的概率值。

连续随机变量: 可以在一个区间内取任何值。例子:

  • 某只股票今天的日回报:可能是 1.234%,也可能是 -0.567%
  • 明天下午 2 点的气温
  • 一瓶啤酒的实际灌装量(目标是 500ml,实际可能是 499.7ml, 500.3ml......)

连续随机变量的概率用 PDF(Probability Density Function,概率密度函数)描述。关键区别:对于连续变量,P(X=某个精确值) = 0——你不关心 P(回报=恰好 1.234%),你关心 P(回报落在 1% 到 2% 之间)。用面积来算概率。


3.2 二项分布 —— "n 次独立试验,每次成功概率 p"

某 PE 看了 10 个项目,每个项目独立地有 30% 的概率通过初筛。问:恰好 4 个通过的概率是多少?

PMF: P(X=k) = C(n,k) × pᵏ × (1-p)ⁿ⁻ᵏ

其中 C(n,k) = n! / [k!(n-k)!],读作"n 选 k"。

完整手工计算:

n = 10(总共 10 个项目),p = 0.30(每个项目 30% 通过),k = 4(我们关心恰好 4 个通过)

Step 1: 组合数 C(10,4) = 10!/(4!×6!) = (10×9×8×7)/(4×3×2×1) = 5040/24 = 210

Step 2: pᵏ = 0.30⁴ = 0.30 × 0.30 × 0.30 × 0.30 = 0.0081

Step 3: (1-p)ⁿ⁻ᵏ = 0.70⁶ = 0.70 × 0.70 × 0.70 × 0.70 × 0.70 × 0.70 = 0.117649

Step 4: P(X=4) = 210 × 0.0081 × 0.117649 = 210 × 0.000953 = 0.2001 ≈ 20.0%

扩展计算 —— P(至少 1 个通过): P(X ≥ 1) = 1 - P(X=0) = 1 - C(10,0) × 0.30⁰ × 0.70¹⁰ = 1 - 1 × 1 × 0.02825 = 1 - 0.02825 = 0.97175 ≈ 97.2%

即使每个项目只有 30% 的通过率,看 10 个项目拿到至少一个好项目的概率也高达 97%。这就解释了为什么 PE/VC 必须大量看项目——单个项目的成功率并不重要,重要的是 pipeline 的广度。

二项分布第二个实例——质量控制

某啤酒罐装线的次品率稳定在 2%。质检每批随机抽取 50 罐。问:在一批样品中恰好发现 0 罐次品的概率是多少?

n=50,p=0.02,k=0。C(50,0) = 1。P(X=0) = 1 × 0.02⁰ × 0.98⁵⁰ = 0.98⁵⁰。计算:0.98⁵⁰ 用手算太麻烦,但可以用近似:ln(0.98⁵⁰) = 50 × ln(0.98) = 50 × (-0.0202) = -1.01。e^(-1.01) ≈ 0.364。所以约有 36.4% 的概率一个次品都找不到——尽管产线确实在持续产生次品(2% 次品率)。

问:至少发现 1 罐次品的概率?P(X ≥ 1) = 1 - P(X=0) = 1 - 0.364 = 63.6%。所以约三分之二的批次中会发现至少一罐次品——这决定了质检能不能"睡大觉"(不能,63.6% 的批次会触发警报)。

面试应用: 二项分布是离散事件的"go-to distribution"。适用于"n 次独立试验,每次成功概率恒定"的场景。投行面试中出现的任何计数问题(几笔交易会违约、几个项目会成功、几个候选人会通过)都可以用二项分布框架来回答。

二项分布的参数:

参数公式本例
均值 E[X]np10×0.30 = 3.0
方差 Var(X)np(1-p)10×0.30×0.70 = 2.1
标准差√[np(1-p)]√2.1 ≈ 1.45

3.3 正态分布 —— 为什么它无处不在

如果你这辈子只学一种概率分布,那就学正态分布。中心极限定理告诉我们:无论原始分布长什么样,只要样本量够大,样本均值的分布就近似正态。这就是为什么正态分布在实际中无处不在。

PDF 公式(看看就好,不必背):

f(x) = (1/(σ√(2π))) × exp(-(x-μ)²/(2σ²))

两个参数控制了形状:μ(均值)决定中心位置,σ(标准差)决定"宽度"——σ 越大,钟形曲线越扁越胖。

Z 分数(Z-score):

Z = (X - μ) / σ。Z 是一个"单位换算"——把任何正态分布都转化到标准正态分布 N(0,1),然后用同一张表查概率。"离均值几个标准差"——这就是 Z 的直观含义。

比如:你的身高比同龄人平均高 1.5 个标准差,Z = 1.5,对应大约前 6.7%(P(Z>1.5) ≈ 0.067)。

完整手工案例 —— S&P 500 日回报概率:

假设 S&P 500 日回报服从 N(μ=0.04%, σ=1.2%)。问:随机挑一天,日回报低于 -2% 的概率是多少?

Step 1: 定义问题。求 P(X < -2%)

Step 2: 计算 Z 分数。Z = (-2% - 0.04%) / 1.2% = -2.04 / 1.2 = -1.70

Step 3: 查标准正态分布表。P(Z < -1.70) = 0.0446(查表:Z=1.70 → 0.0446)

Step 4: 结论。大约 4.5% 的概率——换句话说,大约每 22 个交易日就有一天跌超 2%。这不是罕见事件。

68-95-99.7 规则(经验法则):

范围概率金融含义(日回报 N(0.04%, 1.2%))
μ±1σ:-1.16% ~ 1.24%68%约三分之二的日子在这个范围内
μ±2σ:-2.36% ~ 2.44%95%大多数日常波动在此范围内
μ±3σ:-3.56% ~ 3.64%99.7%超出 ±3σ 在正态下概率仅 0.27%,但实际中并不罕见(肥尾问题)

面试提示: 当被问到"某事件发生的概率是多少"时,先判断能不能用正态分布近似,然后标准化,然后查 Z 表。这三个步骤在任何面试中都是满分回答的结构。

第二个完整案例 —— 反向思维:从概率反推 z 值

一家投行的招聘笔试中,数学部分是正态分布评分 N(μ=70, σ=12)。前 10% 的考生进入面试轮。问:进入面试的最低分数是多少?

Step 1: P(Z > z_cutoff) = 0.10 → P(Z ≤ z_cutoff) = 0.90

Step 2: 查标准正态表,P(Z ≤ z) = 0.90 → z = 1.28(最常见的一个 z 值,建议记住:z=1.28 对应 90%,z=1.645 对应 95%,z=1.96 对应 97.5%,z=2.33 对应 99%)

Step 3: X = μ + z×σ = 70 + 1.28×12 = 70 + 15.36 = 85.36。进入面试的最低分数大约 85 分。

这个技巧在 PE 的 Portfolio 分析中经常用到:给定回报分布 N(μ,σ),"最差的 5%(VaR 阈值)在哪里?"——答案永远在 μ - 1.645σ。

Q-Q 图(Quantile-Quantile Plot)概念:

检查数据是否服从正态分布的最简单方法:把实际数据的分位数画在 y 轴,理论正态分布的分位数画在 x 轴。如果点大致落在一条直线上,则是正态分布。如果两头翘起(远离直线),则是肥尾。Q-Q 图不是计算工具,但面试中你说"我们先画个 Q-Q 图看看是不是正态分布"——这句话本身就展示了统计学素养。

Q-Q 图的读法口诀:中间离直线 → 偏度;两头翘 → 肥尾。 实际投行研报中,很多研究员会用 Q-Q 图来论证"不应该用正态分布假设做风险建模"。


3.4a Z 表实战速查 —— 最常用的几个 Z 值

标准正态表中你真正需要记住的值只有这么几个。其他所有值都可以用这些做锚点来推算:

Z 值P(Z ≤ z)P(Z > z)含义
0.000.50000.5000均值
1.000.84130.1587约 1/6 的概率超过 1σ
1.280.89970.100310% 尾部(面试常用)
1.6450.95000.0500α=0.05 单侧临界值
1.960.97500.025095% CI 双侧临界值
2.000.97720.0228约 2.3% 概率超过 2σ
2.330.99010.0099α=0.01 单侧临界值(99% VaR)
2.580.99510.0049α=0.01 双侧临界值(99% CI)
3.000.99870.0013"3-sigma" —— 正态下约 1/770

查表技巧: 标准正态表通常给的是 P(Z ≤ z) 即从左边累计到 z 的面积。要求 P(Z > z),用 1 减去这个值。要求 P(a < Z < b),用 P(Z≤b) - P(Z≤a)。负 z 值利用对称性:P(Z < -z) = P(Z > z) = 1 - P(Z ≤ z)。

面试中最容易忘的一个: α=0.05 双侧检验的临界值是 ±1.96(不是 1.645,1.645 是单侧的)。双侧的意思是你"不预设方向"——不管基金经理超额收益是正还是负,只要偏离 0 足够大就是异常。单侧是你"只关心一个方向"——只关心基金经理是否有"正"超额收益。搞清楚单侧还是双侧是面试中的基本要求。

3.4 肥尾问题 —— 为什么金融数据不服从正态分布

如果金融市场服从正态分布,1987 年黑色星期一的 22% 单日暴跌的概率大约是 10⁻⁵⁰——这个数字小到可以理解为"宇宙大爆炸以来一次都不会发生"。但它发生了。而且不止一次。

正态分布 vs t 分布的尾部比较

同样是 5 个标准差事件(5-sigma event):

  • 正态分布:P(|Z| > 5) ≈ 5.7 × 10⁻⁷,约 175 万分之一。如果每天一次试验,理论上是约 4800 年一遇。
  • t 分布(df=3):P(|t| > 5) ≈ 0.005,约 200 分之一。大约每 200 个交易日就一次。

S&P 500 自 1950 年以来的实际数据中,5-sigma 日发生了数十次——远多于正态分布的预测,少于 t(3) 的预测。经验结论:金融数据大致介于正态和 t 分布之间——比正态"肥"但不像 t(3) 那么极端。

检查正态性的方法

Jarque-Bera 检验(概念): 同时用偏度和峰度来检验正态性。如果数据是正态的:

  • 偏度应该接近 0
  • 超额峰度应该接近 0

JB 统计量大(p 值小)→ 拒绝正态性假设。这是 EViews 等计量软件的标准输出之一——投行面试中你可能被问到"怎么看一个数据集是不是正态的",Jarque-Bera 是标准答案。

肥尾对风险管理意味着什么?

如果日回报真的有"肥尾",那么用正态分布做风险建模会发生什么?举个例子:你是一个风险管理分析师,被要求计算 Daily VaR(Value at Risk,每日在险价值),也就是"在 99% 的置信度下,一天最多亏多少"。

如果日回报 ~ N(0%, 1.5%),99% VaR = 0 + 2.33×1.5% = 3.5%。也就是说,在正态假设下,一天亏超过 3.5% 的概率只有 1%,即大约每 100 个交易日才出现一次。但如果真实分布是肥尾的(比如 t 分布,df=4),1% 分位点可能在 5% 左右——你低估了 1.5 个百分点。在 10 亿美元的 portfolio 上,1.5% 就是 1500 万美元的风险低估。

2008 年金融危机后,CFO 们要求 quant 团队不要只用正态分布做 VaR——这个要求在投行面试中是个加分话题。你可以提一句:"应该用历史模拟法或者极值理论(EVT,Extreme Value Theory)来校准肥尾风险。"


第四节:假设检验 —— 科学方法的统计实现

这是一百年来统计学最核心的方法论。"这个基金经理到底有没有 Alpha?""新药是不是真的比安慰剂有效?""A/B test 中 B 版本真的更好吗?"——这些问题要的不是"好像有",而是"证据强到我们可以排除运气因素"。

4.1 假设检验的逻辑框架

核心隐喻:刑事审判。 H₀(原假设)= "被告是无辜的"。你收集证据。如果证据强到"在无辜假设下几乎不可能出现",陪审团拒绝 H₀(判有罪)。但如果证据不够强呢?——只能说"没有足够的证据证明有罪"(未能拒绝 H₀)。你从来不说"证明了他无辜"。

标准流程:

  1. 设立 H₀(零假设,通常代表"无效应/无差异")和 H₁(备择假设)
  2. 选择显著性水平 α(通常 0.05 或 0.01)——"我愿意接受多高的冤案率?"
  3. 收集数据,计算检验统计量
  4. 比较检验统计量与临界值,或比较 p 值与 α
  5. 结论:Reject H₀(有显著证据)或 Fail to reject H₀(证据不足)

关键词: 我们永远不"接受 H₀"。我们说"未能拒绝 H₀"——这两者有天壤之别。前者意味着"我证明它是对的",后者意味着"证据不够,我不下结论"。


4.2 单样本 z 检验 —— 完整手工计算

实战案例 —— 基金经理 Alpha 检验:

某基金经理声称他有 Alpha(选股能力),即他的组合月均超额收益 > 0。过去 36 个月,月均超额收益 x̄ = 0.45%,已知总体标准差 σ = 2.0%(行业经验值)。问:这些数据是否提供了"该基金经理有 Alpha"的充分证据?

Step 1 —— 设立假设: H₀:μ = 0(没有 Alpha,超额收益为零);H₁:μ > 0(有正 Alpha) 这是单侧检验(one-tailed),因为我们只关心"正 Alpha",不是"有没有 Alpha(可以是正或负)"。

Step 2 —— 确定 α: α = 0.05。意思是:我愿意接受 5% 的概率"把一个没有 Alpha 的人判为有 Alpha"(第一类错误)。

Step 3 —— 计算检验统计量: z = (x̄ - μ₀) / (σ/√n) = (0.45 - 0) / (2.0/√36) = 0.45 / (2.0/6) = 0.45 / 0.3333 = 1.35

分母 σ/√n = 2.0/6 = 0.333% 是"均值标准误"(Standard Error of the Mean),意思是:如果原假设为真(μ=0),36 个月的样本均值会有多大的自然波动。

Step 4 —— 临界值: 查 Z 表,α = 0.05 单侧 → z_critical = 1.645

Step 5 —— 比较: 1.35 < 1.645 → z 统计量未超过临界值 → 未能拒绝 H₀

结论: 尽管观测到了 0.45% 的月均超额收益,但这个量级下,数据不足以排除"运气"这个解释。我们没有充分证据说这位基金经理有真正的 Alpha。注意:我们没有说他"没有 Alpha"——我们只是说"证据不够"。


4.3 p 值 —— "数据有多极端"

p 值 = 在原假设 H₀ 为真的前提下,观察到与我们所得一样极端(或更极端)的检验统计量的概率。

公式: p-value = P(检验统计量 ≥ 观测到的值 | H₀ 为真)

续前例 —— 计算 p 值:

我们的 z = 1.35,单侧检验。查标准正态表:P(Z > 1.35) = 1 - P(Z ≤ 1.35) = 1 - 0.9115 = 0.0885。

p = 0.0885。意味:如果这个基金经理真的没有 Alpha(μ=0),纯粹靠运气拿到 0.45% 以上月超额收益的概率大约是 8.9%。

比较:p = 0.0885 > α = 0.05 → 无法拒绝 H₀(与临界值方法的结论一致)。

关于 p 值的常见错误理解(面试必考点)

错误说法为什么错
"p 值 = H₀ 为真的概率"严重错误。 p 值是 P(数据∣H₀),不是 P(H₀∣数据)。这二者通过贝叶斯定理连接(还记得前面吗?),但在频率学派中,p 值不直接回答"假设有多可能是真的"。
"p > 0.05 意味着 H₀ 为真"错误。 只是"证据不够"。可能样本太小,可能效应确实不存在。
"p < 0.05 意味着效应很大"错误。 p 值只告诉你"不太像随机噪音",不告诉你效应大小。效应大小看 estimate(如 x̄-μ₀ = 0.45%),精度看置信区间。
"p < 0.05 意味着结论很重要"错误。 巨大样本下,微小而不重要的效应也能显著。小样本下,重要的大效应也可能不显著。

正确理解: p 值是"在 H₀ 为真的前提下,数据看起来有多极端。"p 值小 → "在零假设下出现这种数据太不寻常了"→ 倾向于拒绝 H₀。p 值大 → "零假设下这种数据挺正常"→ 不能拒绝 H₀。


4.4 第一类错误与第二类错误

没有人是完美的,统计推断也一样。

H₀ 为真(无效应)H₀ 为假(有效应)
拒绝 H₀Type I Error(α)——冤案正确(Power = 1-β)
未拒绝 H₀正确(1-α)Type II Error(β)——漏网

第一类错误(False Positive): 错杀好人。α = P(拒绝 H₀ ∣ H₀ 为真)。你设定 α = 0.05,就是接受了 5% 的冤案率。

第二类错误(False Negative): 放过坏人。β = P(未能拒绝 H₀ ∣ H₁ 为真)。换句话说:有效应存在,但你的检验没能检测到。

检验功效(Power): 1-β = 当有效应真实存在时,你成功检测到它的概率。

一个将贝叶斯逻辑和假设检验结合的实例

某量化团队筛选了 100 个交易策略。实际上,其中 5 个是真正有效的(有真实 Alpha),95 个是噪音。设定 α = 0.05,Power = 0.80(80% 的有效策略会被正确检测到)。

预期结果:

  • 真正有效的 5 个中,被正确检出的 = 5 × 0.80 = 4 个
  • 噪音中 95 个中,被错误检出的 = 95 × 0.05 ≈ 5 个
  • 总共 4+5 = 9 个策略被判为"显著"
  • 在被判为显著的那些策略中,真正有效的比例 = 4/9 ≈ 44%

震撼结论: 尽管 α = 0.05 和 Power = 0.80 看起来都是体面的参数,但在 base rate 很低(只有 5% 的策略有效)的情况下,超过一半的"显著"结果其实是噪音。这和第二节贝叶斯定理中罕见病筛查的逻辑完全一致——α 和 p 值是筛子,但筛出来的东西有多可靠,取决于你要找的东西有多罕见。


4.5 多重比较问题 —— "测试得越多,越容易撞上假阳性"

回忆第一节的掷硬币:扔 10 次硬币,连续 10 次正面的概率是 1/1024 ≈ 0.001。但如果有 1000 个人同时扔 10 次,至少有一个人拿到 10 次正面的概率 = 1-(1-0.001)^1000 ≈ 1-0.368 = 63.2%。——这几乎必然发生。

在统计检验中的含义:如果你同时检验 20 个独立的零假设,每个 α = 0.05,那么: P(至少 1 个假阳性) = 1 - (1-0.05)^20 = 1 - 0.95^20 = 1 - 0.358 = 0.642 = 64.2%

你做 20 个检验,有 64% 的概率至少碰上一个假阳性——即使所有 20 个零假设都是真的。 这就是为什么基金公司"测试了几百个因子,最终发现了这个显著因子"这件事你需要高度怀疑。

修正方法

Bonferroni 校正(最保守):

α_adjusted = α / m。检验 20 个假设,使用 α = 0.05/20 = 0.0025 才能维持整体第一类错误率在 5%。 代价巨大:Power 急剧下降,真正有效应可能也被过滤掉。

Benjamini-Hochberg 过程(更实用,控制 False Discovery Rate):

概念层面:把所有 m 个检验的 p 值从小到大排序。设定一个可接受的假发现率(FDR,比如 5%)。确定一个阈值,使得在通过阈值的结果中,假阳性比例不超过 5%。具体的 p 值阈值不是 α/m 那样一刀切,而是根据每个 p 值的排位动态调整的。具体公式今天不讲,但面试中如果你提到 BH procedure 这个名字,已经比 95% 的人强了。


4.6 t 检验 —— 当你不认识真实的 σ

z 检验要求你知道总体标准差 σ——这在实际中几乎是不可能的(如果你知道 σ,你大概率也知道 μ 了)。t 检验用样本标准差 s 替代 σ。代价是:检验统计量的分布不再是正态,而是 t 分布(更肥的尾巴,自由度越小越肥)。

何时用 t 检验: σ 未知,从样本中估计 s;小样本(n < 30);需要更"保守"的推断。

与前述完全相同的数据,但改用 t 检验:

同一个基金经理,36 个月,x̄ = 0.45%,但这次我们不知道 σ,只知道样本标准差 s = 2.0%。H₀:μ = 0,H₁:μ > 0,α = 0.05。

Step 1: t = (x̄ - μ₀) / (s/√n) = (0.45 - 0) / (2.0/√36) = 0.45 / 0.3333 = 1.35

Step 2: 自由度 df = n-1 = 35。

Step 3: 查 t 分布表,df=35,α=0.05 单侧:t_critical ≈ 1.690(t(35) 的临界值比 z 的 1.645 略大——因为尾巴更肥,你需要更强的证据才能拒绝 H₀)。

Step 4: 1.35 < 1.690 → 未能拒绝 H₀。结论与 z 检验相同,但 t 检验更"挑剔"——这很合理,因为我们不确定 σ。

z 临界值 vs t 临界值对比:

dfz_crit (α=0.05单侧)t_crit (α=0.05单侧)
101.6451.812
301.6451.697
601.6451.671
1201.6451.658
1.6451.645

t 分布随 df 增大趋近正态分布。n ≥ 30 时,t 和 z 差距已经不大,但 n 越小差距越明显。

其他常用 t 检验概览:

双样本 t 检验(Two-sample t-test)—— 完整手工实例:

比较两个独立组的均值是否有差异。某咨询公司为百威亚太做消费者测试:80 个消费者随机分为两组,A 组品尝旧配方(对照组),B 组品尝新配方(实验组)。评分(满分 10 分)如下:

A 组(旧配方,n₁=40):x̄₁ = 6.8,s₁ = 1.5 B 组(新配方,n₂=40):x̄₂ = 7.5,s₂ = 1.4

H₀:μ₁ = μ₂(新旧配方无差异),H₁:μ₁ ≠ μ₂(有差异),α = 0.05,双侧检验。

Step 1: 合并标准误(假设等方差):SE = √[s₁²/n₁ + s₂²/n₂] = √[1.5²/40 + 1.4²/40] = √[2.25/40 + 1.96/40] = √[0.05625 + 0.04900] = √0.10525 = 0.3244

Step 2: t = (x̄₂ - x̄₁) / SE = (7.5-6.8)/0.3244 = 0.7/0.3244 = 2.16

Step 3: 自由度 df ≈ n₁+n₂-2 = 78(使用 Welch 近似)。查 t 表,df=78,双侧 α=0.05 → t_crit ≈ 1.99。

Step 4: 2.16 > 1.99 → 拒绝 H₀。新配方显著优于旧配方(p < 0.05)。

商业结论: 新配方平均评分比旧配方高 0.7 分,且差异在统计上显著——建议推进新配方。

配对 t 检验(Paired t-test)—— 概念 + 实例:

双样本 t 检验处理的是两组独立的人或物。配对 t 检验处理的是同一组对象在两种条件下的差异。控制了个体差异,因此比双样本更有检验力(power 更大)。

实例:10 位分析师参加为期一周的财务建模培训。培训前后各完成一套相同难度的建模测试(满分 100 分)。

分析师培训前培训后差值 d
16270+8
25864+6
37578+3
47076+6
56572+7
66066+6
76873+5
87279+7
95562+7
108083+3

先算差值的均值和标准差:d̄ = (8+6+3+6+7+6+5+7+7+3)/10 = 58/10 = 5.8。差值的样本标准差 s_d:各 d 离差平方和 = (8-5.8)²+(6-5.8)²+(3-5.8)²+(6-5.8)²+(7-5.8)²+(6-5.8)²+(5-5.8)²+(7-5.8)²+(7-5.8)²+(3-5.8)² = (2.2)²+(0.2)²+(-2.8)²+(0.2)²+(1.2)²+(0.2)²+(-0.8)²+(1.2)²+(1.2)²+(-2.8)² = 4.84+0.04+7.84+0.04+1.44+0.04+0.64+1.44+1.44+7.84 = 25.60。s_d = √[25.60/9] = √2.844 = 1.686。

t = d̄/(s_d/√n) = 5.8/(1.686/√10) = 5.8/0.533 = 10.88。df=9,双侧 t_crit(α=0.05,df=9) = 2.262。10.88 >> 2.262 → 极强的显著性。培训确实提升了建模能力。注意:配对检验的 t 值远大于双样本——因为"每个人当自己的对照",个体间的基线差异被排除了,检验力更高。


第五节:置信区间 —— "我们有多确定"

假设检验告诉你一个"是/否"的答案。置信区间(Confidence Interval, CI)给你一个"范围"——效应有多大?估计有多精确?面试中,给出一个"点估计 + 95% CI"的回答总是优于只给点估计。

5.1 均值的置信区间

公式(σ 已知): 95% CI = x̄ ± z_0.025 × σ/√n

公式(σ 未知:) 95% CI = x̄ ± t_0.025,df × s/√n

续前例 —— 基金经理超额收益的 95% 置信区间:

x̄ = 0.45%,σ = 2.0%,n = 36。z_0.025 = 1.96(双侧 2.5% 的尾部)。

标准误(SE)= σ/√n = 2.0/6 = 0.3333%

误差边际(Margin of Error)= 1.96 × 0.3333% = 0.6533%

95% CI = 0.45% ± 0.653% = [-0.203%, 1.103%]

解读——正确方式: 如果我们重复这个实验很多次(每次取 36 个月的数据,算一个 CI),那么这些 CI 中有 95% 会包含真实的 μ。

解读——错误方式: "真实 μ 有 95% 的概率落在这个区间内。"在频率学派框架中这句话是错的——真值不是随机变量,它是固定的。CI 才是随机的。

解读——贝叶斯学派: 贝叶斯学派有"可信区间"(Credible Interval),它的解释就是"μ 有 95% 概率落在此区间"。面试中如果能分清 Confidence Interval(频率学派)vs Credible Interval(贝叶斯学派),是非常强的加分项。

关键信息: 95% CI 包含 0 → 不能拒绝 H₀:μ=0(双侧检验,α=0.05)。这与前面假设检验的结论一致——CI 和假设检验在数学上是等价的。


5.2 比例的置信区间

当你在做市场调研或用户调查时,你关心的不是连续变量的均值,而是一个比例(市场份额、满意度、转化率等)。

公式(大样本,使用正态近似): 95% CI for p = p̂ ± z_0.025 × √[p̂(1-p̂)/n]

此处 p̂ 是样本比例,√[p̂(1-p̂)/n] 是标准误(SE)。

完整实例 —— 消费者市场份额调查:

某咨询公司受百威亚太委托,调查中国高端啤酒市场。随机抽样 500 名消费者,165 人首选品牌 A。p̂ = 165/500 = 0.330 = 33.0%。

Step 1: 标准误 SE = √[p̂(1-p̂)/n] = √[0.33×0.67/500] = √[0.2211/500] = √0.0004422 = 0.02103

Step 2: z_0.025 = 1.96。误差边际 = 1.96 × 0.02103 = 0.04122 ≈ 4.12 个百分点

Step 3: 95% CI = [33.0% - 4.12%, 33.0% + 4.12%] = [28.88%, 37.12%]

解读: 我们有 95% 的置信度认为品牌 A 的真实市场份额在 28.9% 到 37.1% 之间。误差边际约 4.1%(常被称为"抽样误差 ±4.1%")。

样本量如何影响 CI 宽度:

标准误 ∝ 1/√n。如果样本量翻倍(500→1000),SE 缩小为原来的 1/√2 ≈ 0.707 倍。CI 宽度同步缩小为原来的 71%。想要 CI 宽度减半 → 需要样本量翻四倍。这是"为什么好的调查这么贵"的数学解释。


5.3 CI vs 假设检验的关系

假设检验置信区间
二元的:显著 / 不显著连续的:效应大小的可能取值范围
不告诉你效应有多大直接给出效应大小的范围 + 精度
易于误解 p 值更直观,不容易被滥用

等价关系: 在双侧检验中,95% CI 不包含 0 ⟺ 在 α=0.05 下拒绝 H₀。对于差异的 CI:如果 μ₁-μ₂ 的 95% CI 不包含 0,则双样本检验在 α=0.05 下显著。

面试最佳实践: 不只报告"结果是否显著",同时报告点估计和 95% CI。比如:"该策略的月均超额收益为 0.45%,95% CI 为 [-0.20%, 1.10%],未能排除零效应(p=0.089)。"——这一句话包含了所有关键信息。

为什么 95% 而不是 90% 或 99%?

这个问题在面试中也偶尔被问到。95% 置信度是一个"社会契约"——Fisher 早年提出 p<0.05 作为"值得再研究一次"的初步门槛,后来行业逐渐固化为"发表标准"。本质上:90% CI 太窄(犯错率 10% 太高),99% CI 太宽(样本量要求太高,实际中往往做不到)。95% 是中间的一个实用折中。但在某些领域标准不同:物理学发现粒子要求 5-sigma(p ≈ 3×10⁻⁷),而某些社会科学中 p<0.10 也被视为"边际显著"。关键不是死记 α=0.05,而是知道**"α 越小,结论越保守,样本量需求越大"**这个 trade-off。


第六节:相关性 vs 因果关系 —— 你不能在面试中搞错

这是统计推断中最危险的一个陷阱,也是面试中最常被考察的概念区分。如果你在投行/咨询面试中说"数据显示 A 和 B 高度相关,所以 A 导致 B"——面试官大概率已经在心里画了个叉。

6.1 伪相关与遗漏变量

冰淇淋销量和溺水死亡人数高度正相关(r≈0.8)。所以吃冰淇淋会导致溺水?当然不是。第三个变量——夏天的高温——同时导致更多人吃冰淇淋和更多人游泳(进而更多溺水)。

这个"第三个变量"叫做混淆变量(Confounding Variable)。遗漏了它,你就会看到 A 和 B 之间本不存在的"因果"假象。这叫遗漏变量偏误(Omitted Variable Bias)。

经典案例 —— MBA 毕业的 CEO 是否带来更好的公司业绩?

数据显示:MBA 毕业的 CEO 领导的公司,平均 ROE 比非 MBA CEO 高 3 个百分点。所以 MBA 教育提升了公司业绩?不一定是因果。可能是:

  • 更好的公司(本身 ROE 就高)更愿意花钱请 MBA CEO(逆向因果)
  • 出身富裕家庭的人更可能读 MBA,同时他们的人脉更有助于拿到好公司的 CEO 职位(遗漏变量)

伪相关展览馆 —— 数学不撒谎,但也不思考:

美国在科学、空间和技术上的支出,与上吊自杀人数之间的相关性 r = 0.99(1999-2009 年)。德国每人的奶酪消费量,与被床单缠住而死亡的人数之间的相关性 r = 0.95。这些是真实的统计相关性,但显然毫无因果关系——这是"数据挖掘"的必然产物:在几百万对变量中,总会有些纯靠巧合出现高相关。

遗漏变量偏误的 DAG 直觉

DAG(有向无环图,Directed Acyclic Graph)是经济学家和流行病学家用来形式化因果关系的工具。画法:

遗漏变量情况:Z → X,Z → Y。如果你只看 X 和 Y 的相关而忽略 Z,你就在测量一条被 Z 污染的假关系。

正确做法:在面试中,当你被要求解释"为什么 A 和 B 相关"时,永远先问自己:"有没有一个 C,它既影响 A 又影响 B?"

一个面试中常见的"因果 vs 相关"辨析题

"数据显示,喝红酒的人心脏病发病率更低。所以红酒预防心脏病。"——这个论证有什么问题?

可能的混杂因素: 喝红酒的人往往收入更高(红酒比啤酒贵),收入高的人有更好的医疗条件、更健康的饮食、更多的锻炼时间。不是红酒本身有魔力,而是"有钱喝红酒"这个行为与"有钱保持健康"高度相关。法国的"法式悖论"(高饱和脂肪饮食但心脏病发病率低,归功于红酒)后来被发现更大程度上是数据记录方式(法国死亡证明的心脏病分类与美国不同)和饮食整体模式(地中海式饮食的多元蔬菜、橄榄油、鱼)导致的,红酒中的白藜芦醇的效果远没有最初声称的那么大。

面试要点: 永远区分"observational association"和"causal effect"。对于观测数据提出的因果主张,你的第一反应应该是:"How would you design an RCT to test this?"——然后再退回来讨论为什么不能用 RCT(伦理、成本、可行性),以及替代方案(DiD、RD、IV 等)。


6.2 因果推断方法概览

既然观测数据里的相关性不能直接解释为因果,社会科学和商业分析就发展了一套专门的"因果推断"工具箱。面试中你能说出这些方法的名字和基本逻辑即可。

随机对照试验(RCT —— Randomized Controlled Trial)

黄金标准。 随机将受试者分为处理组和对照组,唯一的系统差异就是"是否接受处理"。因为分组是随机的,两组在一切可观测和不可观测的变量上都(在期望上)均衡。因此,组间结果的差异可以归因为处理本身。

局限性: 贵,慢,有些情况下不道德(不能让一组人不接受教育来做对照),有些情况下不可行(宏观经济政策不能随机分配给不同国家)。

双重差分(Difference-in-Differences, DiD)

简单实例 —— 最低工资对就业的影响:

州 A 在 2022 年将最低工资从 $12 提高到 $15。州 B 没有改变(保持 $12)。

数据:

  • 州 A:2021 年就业率 95%,2023 年就业率 93%(变化 = -2%)
  • 州 B:2021 年就业率 94%,2023 年就业率 93%(变化 = -1%)

DiD = (93%-95%) - (93%-94%) = (-2%) - (-1%) = -1%

结论:在考虑到全国性趋势(州 B 也下降了 1%)之后,最低工资提高的"净效应"大约是减少 1% 的就业率。这就是双重差分的核心思想:先差分(before vs after),再差分(treatment vs control),把"自然趋势"从"处理效应"中剥离。

断点回归(Regression Discontinuity, RD)

概念: 利用一个任意的分界线来做因果推断。例如:奖学金只发给高考分数 ≥600 的学生。考 599 分的学生和考 600 分的学生,除了是否拿到奖学金外,在能力上几乎完全相同。比较这两个人群的大学成绩——这个差异可以归因为奖学金的效果。

"分界线两侧几乎等同的人群"是 RD 识别因果效应的核心假设。

工具变量(Instrumental Variable, IV)

概念层面:找一个变量 Z,它影响 X(处理变量),但不直接影响 Y(结果变量),而且只通过 X 影响 Y。Z 就是一个"工具"。最经典的例子是:用"降雨量"作为"冲突爆发"的工具变量来研究冲突对经济增长的影响——降雨量影响农业产出→影响冲突→但降雨量不直接影响 GDP 增长。


第七节:经典统计陷阱 —— 面试中绝对不能犯的错

7.1 幸存者偏差(Survivorship Bias)

"二战时,军方检查返航的战斗机,发现机翼上弹孔最多,于是决定加固机翼。"一个统计学家(亚伯拉罕·瓦尔德)指出:不,应该加固弹孔最少的地方(引擎和油箱)——因为被击中那里的飞机根本就没有返航。

你只能看到"活下来"的样本。活下来的人带有特定的特征(比如机翼上弹孔多)——但这不代表那些特征导致了存活。

数值演示 —— 为什么"好基金"的业绩会高估

模拟实验:1000 只基金同时起步,每只基金的年回报独立随机,服从 N(8%, 20%)。每年如果一只基金的累计净值跌到 0.50 以下("腰斩"),假设清盘退出。运行 10 年。

初始:1000 只基金,真实能力均值 = 8%/年。 10 年后:约 200 只基金存活(800 只在某个时点跌破 0.50 被清盘)。 存活的 200 只基金的平均年化回报:约 12%。 但所有 1000 只基金的真实平均年化回报仍然是 8%。 幸存者偏差的效应:你观察到的 12% 比真实的 8% 高出了 4 个百分点——纯粹是因为表现差的基金消失了。

面试中的应用: "我们发现顶级 PE 基金的回报率很高"——这可能是幸存者偏差:回报率差的 PE 基金不再募资,你根本看不到它们。对冲基金数据库(如 HFR)存在著名的"回填偏差"(backfill bias):基金只有表现好之后才会主动提交数据。

幸存者偏差的另一个经典商业案例

某招聘平台统计了平台上自由职业者的收入,报告称"自由职业者平均年收入 25 万,比上班族高 40%"。问题在哪?收入低于某个阈值的自由职业者可能已经退出了平台(回公司上班了),你统计的是"留下来的人"——而留下来的人恰恰是做得还不错的那批。还有,兼职赚外快的上班族可能根本不注册这种平台。

面试中怎么用: 当你在咨询案例中被要求分析一个行业的"平均业绩"时,先问:"这个平均数是从哪来的?谁被排除在外了?谁被包括进来了?退出的、失败的、不回答的那些数据在哪?"


7.2 选择性偏差(Selection Bias)

样本不是随机抽取的,而是以一种与结果变量相关的方式被"选入"样本——样本不再代表总体。

经典案例: 通过问卷调查"大学毕业生毕业五年后的平均薪资"。高薪的人更愿意回应调查(骄傲),低薪的人更不愿意回应(羞愧)→ 调查结果有偏。

Heckman 校正(概念层面): 诺贝尔奖得主 James Heckman 的方法:建立一个两步模型。第一步预测"被观测到的概率"(选择方程),第二步在修正了选择偏误后预测"结果"(结果方程)。实际操作需要专门的计量软件,但面试中能说出这个概念已经足够。


7.3 辛普森悖论(Simpson's Paradox)

分组看,A 每一组都比 B 好;但合起来看,B 总体比 A 好。原因:各组的样本量不同,而且在"更难"的组中 A 有更多样本。

经典案例 —— 某大学研究生录取中的性别偏倚争议:

学院男性申请数男性录取录取率(男)女性申请数女性录取录取率(女)
商学院80048060%20013065%
法学院2004020%80018022.5%

看每个学院: 商学院的女生录取率 65% > 男 60%。法学院的女生 22.5% > 男 20%。看起来没有性别偏倚,甚至女生还有优势。

但合并起来看总体: 男总录取率 = (480+40)/(800+200) = 520/1000 = 52% 女总录取率 = (130+180)/(200+800) = 310/1000 = 31%

合并后,男性录取率 52%,女性 31%。悖论的解释:女性更倾向于申请法学院(录取率低),男性更倾向于申请商学院(录取率高)。性别和学院选择之间存在 confounding。

商业应用: 比较两个销售团队的转换率时,A 队总体高,但 B 队在每种客户类型中都高于 A 队——可能因为 A 队的客户 mix 中"容易成交"的类型占比更高。没有做 mix adjustment 之前,A 队的成绩不代表他们的能力更强。

辛普森悖论的第二个商业实例 —— 广告投放渠道比较

某电商公司的营销团队比较两种广告渠道的转化率:

渠道移动端展示数移动端转化移动转化率PC端展示数PC端转化PC转化率
渠道A500050010.0%1000505.0%
渠道B100012012.0%50003006.0%

在每个设备类型上,渠道 B 的转化率都高于渠道 A(移动 12%>10%,PC 6%>5%)。但看总数据:A 总转化率 = (500+50)/(5000+1000) = 550/6000 = 9.17%。B 总转化率 = (120+300)/(1000+5000) = 420/6000 = 7.00%。A 总体更高——为什么?因为 A 的流量中有 83% 在转化率更高的移动端,而 B 只有 17%。渠道和设备类型之间有 confounding。

解决方案: 用标准化/加权平均来校正。以 A 和 B 合在一起的设备 mix 作为权重(移动 60% vs PC 40%):A 标准化转化率 = 10%×0.6+5%×0.4 = 8.0%。B 标准化转化率 = 12%×0.6+6%×0.4 = 9.6%。校正后,B 确实更好。面试中遇到辛普森悖论:先拆分子组看,如果方向反转,就找到"权重差异"在哪个维度;然后用标准化做校正。


7.4 回归到均值(Regression to the Mean)

如果某件事第一次测量时极端地高,第二次测量时它通常会更接近平均值——这不是因为任何机制在起作用,纯粹是统计规律。

为什么? 极端值 = 真实能力 + 极端运气。能力是稳定的,但运气不持久。下一次,运气大概率回归到"普通"水平,所以总结果回归到均值。

基金经理的"年度之星"魔咒:

每年晨星(Morningstar)都会评选"基金经理年度之星"。数据显示:获奖当年的平均超额收益在行业中排前 1%。获奖后三年的平均超额收益:往往低于行业中位数。 不是因为他们"骄傲了"或者"能力退化了"——而是因为获奖那年的极端业绩大概率包含了巨大的运气成分。运气不持续,业绩回归均值。

面试中的应用: 当听到"某某销售员今年业绩翻了 5 倍,我们明年计划都按这个增速排"——你应该警觉。明年的增速大概率会大幅回落。不是销售员变差了,是"回归到均值"。


7.5 赌徒谬误(Gambler's Fallacy)

"这个硬币连续 10 次正面了,下一次反面的概率一定很高。"——错。如果硬币是公平的,每次投掷独立,P(反) 永远是 50%。硬币没有记忆。

在投资界:"这只股票连续涨了 5 天,明天肯定要回调。"——这是对随机游走的误解。如果价格变化接近随机,昨天涨不意味着今天跌。

均值回归 vs 赌徒谬误 —— 如何区分?

均值回归(是真的)赌徒谬误(是错的)
机制存在一个稳定的"均值",偏离后会有一个力把它拉回来独立事件,没有拉回的力
例子P/E 比率:过高时企业盈利跟不上,估值终究回落硬币抛掷:每次独立
例子运动员的赛季表现:运气均值回归轮盘赌号码:每次独立
关键问题"有一个稳定的长期均值吗?""每次事件是否独立?"

如果存在一个基本面锚定的"均衡水平"(如 P/E 的历史均值、利率的长期均衡),超调后回归是有理论依据的。但如果事件独立(如每一次轮盘旋转),"该回来了"只是大脑的模式识别机制在欺骗你。


面试题一览

以下题目涵盖了本周的核心概念。建议不仅看答案,更重要的是一边做一边自言自语——面试中你要把思考过程讲出来。

题 1: 某 VC 的历史数据显示,投资的项目中 20% 成功退出。成功退出的公司中,70% 在 A 轮之前就有付费客户。失败的公司中,只有 25% 在 A 轮之前有付费客户。现在面前一个新项目,A 轮之前已经有付费客户。问:这个项目成功退出的概率是多少?

解题思路: 贝叶斯定理。设 S=成功退出,C=有付费客户。P(S)=0.20,P(C|S)=0.70,P(C|非S)=0.25,P(非S)=0.80。P(S|C) = (0.70×0.20)/(0.70×0.20+0.25×0.80) = 0.14/(0.14+0.20) = 0.14/0.34 = 41.2%。初始信念 20% → 更新为 41.2%。


题 2: 某银行新开发了一套 AI 反欺诈系统。历史数据显示交易中欺诈率约为 2%。系统的检出率(抓出真正欺诈)为 95%,误报率(把正常交易标记为欺诈)为 5%。如果一笔交易被系统标记了,它真正是欺诈的概率是多少?

解题思路: 另一个贝叶斯定理。F=欺诈,M=被标记。P(F)=0.02,P(M|F)=0.95,P(M|非F)=0.05,P(非F)=0.98。P(F|M) = (0.95×0.02)/(0.95×0.02+0.05×0.98) = 0.019/(0.019+0.049) = 0.019/0.068 = 27.9%。尽管系统看起来不错,但在 2% 的 base rate 下,被标记的交易中只有约 28% 是真正的欺诈。这为什么反欺系统往往依赖多重信号而非单一规则——单规则的阳性预测值不够。


题 3: 你需要检验一位基金经理是否真的有选股能力。他过去 25 个月的年化超额收益均值为 2.4%,年化波动率(σ)历史经验值为 8%。请以 α=0.05 进行假设检验,并计算 95% 置信区间。

解题思路:

  • z 检验:H₀:μ=0,H₁:μ>0。n=25,x̄=2.4%,σ=8%。
  • z = (2.4-0)/(8/√25) = 2.4/1.6 = 1.50
  • 临界值 z_crit(α=0.05,单侧) = 1.645。1.50 < 1.645 → 未能拒绝 H₀。
  • p-value = P(Z > 1.50) = 1-0.9332 = 0.0668。
  • 95% CI = 2.4% ± 1.96×(8/√25) = 2.4% ± 3.136% = [-0.736%, 5.536%]。CI 包含 0,与检验结论一致。

题 4: 解释为什么在医学筛查研究中,一个 99% 准确率的诊断测试在人群筛查中阳性预测值可能只有不到 10%。用贝叶斯公式说明。

解题思路: 见第二节例 2 的完整计算。核心原因:患病率(base rate)极低 → 假阳性人数(健康但被误报的人)远多于真阳性人数(生病且被正确检出的人)。假阳性淹没了真阳性。


题 5: 某公司做了 20 个 A/B 测试来优化网站,每个测试使用 α=0.05。他们发现 3 个测试显著,并据此调整了网站设计。这个决策有什么问题?

解题思路: 多重比较问题。P(至少 1 个假阳性) = 1-0.95²⁰ = 64.2%。在 20 个测试中,即使所有变化都无效,预期也有 1 个假阳性(20×0.05=1)。找到了 3 个显著结果中,可能只有 2 个是真实效果——但也可能 3 个全是假阳性。应该用 Bonferroni 校正(每个检验用 α=0.0025)或 BH 过程来控制 FDR。


题 6: 一家公司报告说"团队平均薪资为年薪 15 万"。你了解到团队有 1 位创始人和 19 名员工。你不信任这个均值。应该问什么?用哪些统计度量?

解题思路: 如果是严重右偏的薪资分布(创始人高额薪酬),均值会被拉高。应该问中位数、分位数(25th, 75th percentile)、或者修剪均值(去掉上下 5%)——这些比均值更能反映"普通员工挣多少"。如果对方不提供这些,可以要原始数据自己算分布形状(直方图、偏度)。如果创始人 300 万,19 个员工都是 6 万,均值 = (300+19×6)/20 = 20.7 万,但中位数 = 6 万。只报告均值是 misleading。


题 7: 一个投资策略过去 10 年的年化回报为 15%,而市场(S&P 500)同期回报为 10%。策略的回报标准差为 25%,市场回报标准差为 15%。相关性为 0.8。你如何判断这个策略的超额收益是否显著?

解题思路: 直接比较 15% vs 10% 忽略了一个关键问题:策略可能只是加了更高的杠杆或承担了更多的系统性风险。CAPM 框架下:Beta = ρ × (σ_strategy/σ_market) = 0.8 × (25%/15%) = 0.8 × 1.667 = 1.333。Beta 为 1.33 的策略,在市场涨 10%(假设 Rf≈0%)时自然会涨 13.3%——多出来的 1.7%(=15%-13.3%)才是"异常"超额收益(Alpha)。然后对这个 Alpha 做 t 检验(需要标准误数据),判断是否显著不等于 0。面试要点:不能说"15%>10%所以好",必须说"控制 Beta 之后的 Alpha 是多少"。


题 8: 在面试中,面试官给你下面这张表,问你看到了什么:

组别人数平均分
整体20075.0
男生10078.0
女生10072.0

面试官说:"男生成绩显著高于女生,差了 6 分。你觉得这合理吗?"

解题思路: 这里面缺少两个关键信息:一是分数的标准差(或标准误)——没有标准误就无法做假设检验;差值 6 分在没有标准差的情况下无法判断是否"显著"。二是可能存在遗漏变量——也许男生更多选了理科课程(评分较松),女生更多选了文科课程(评分较严),如果你按课程分别分析,方向可能反转(辛普森悖论)。正确回答:"我需要知道各组的标准差来判断这 6 分的差异是否统计显著。另外,在我们下结论之前,我想按课程或专业分拆数据,排除潜在的混淆变量。如果能做 t 检验,我会报告 t 统计量、p 值、以及均值差的 95% 置信区间。"


回顾:Day 14 核心要点速查

明天进入 Day 15 之前,请确保你能轻松回答以下问题。它们是你构建量化思维的底层词汇。

概念一句话
中位数 vs 均值右偏分布用中位数,不要被极端值骗了
几何平均 vs 算术平均复合增长(乘法过程)用几何平均,不要用算术平均算复利
标准差平均到每个数据点离中心的典型距离
贝叶斯定理Prior x Likelihood = Posterior;有证据之后更新信念
p 值在 H₀ 为真的前提下,数据看起来有多极端;p 值不是 H₀ 为真的概率
95% 置信区间如果重复实验很多次,95% 的区间会包含真值
第一类错误错杀好人——拒绝了真的零假设(你控制了它的概率 = α)
多重比较检验越多,假阳性越多;Bonferroni 或 BH 必须校正
肥尾金融市场极端事件比正态分布预测的多得多
幸存者偏差只看活着的,活着的看起来都特别强
辛普森悖论每组都是 A 赢,合起来 B 赢——因为权重不同
回归到均值极端表现下次会回来一些——运气不持续
赌徒谬误独立事件没有"该回来了"——硬币没有记忆
伪相关两个变量高度相关不等于有因果关系——先找第三个变量

Day 14 的所有概率、分布、检验——就是明天建模型的积木。在进入回归分析之前,问自己两个问题:我已经能用贝叶斯更新信念了吗?我已经能用 t 检验判断"差异是否显著"了吗? 如果答案是 yes,明天的路就好走多了。如果还有模糊的地方,回到对应的小节,把数字代入手工算一遍——统计不是"看会的",是"算会的"。


明日预告:Day 15 —— 建模与量化决策

今天你学会了怎么描述数据、怎么推断结论、怎么量化不确定性。明天我们将进入"建模"的世界——用数学函数把变量之间的关系写成方程式,然后用数据去"拟合"出最优参数。

Day 15 核心模块预览:

  • 线性回归: 把相关系数升级为"因果关系引擎"——Y = β₀ + β₁X + ε,β₁ 的 t 检验(今天学的!)告诉你 X 是否显著影响 Y
  • 多元回归: 同时控制多个变量,"在控制其他因素不变的前提下,X₁ 增加一单位,Y 变化多少"
  • Logistic 回归: 当 Y 是 0/1 二值变量时(如违约/不违约、购买/不购买),把概率建模
  • ANOVA: 比较三个或更多组的均值是否有差异——t 检验(今天学的!)的推广版
  • 因素分析与聚类: 降维和分组——"这 50 个变量背后本质上是哪 3-4 个因子?"、"这几百个客户可以分几类?"
  • 蒙特卡洛模拟: 面对复杂系统(比如一个投资项目有三种不确定性来源,互相影响),用随机抽样模拟 10000 种"可能的未来",看分布

如果你今天还没完全掌握 p 值和 t 检验,明天在理解"回归系数是否显著"时会遇到困难——因为这些完全依赖今天的内容。花 15 分钟翻回第四节再看一遍,值得。


Day 14 · 概率统计与推断基础 · 2026-08-12

自检清单(明天上课前完成): □ 我能手工算贝叶斯公式的三个例题吗? □ 我能区分单侧和双侧 z 检验并说出临界值吗? □ 我能解释为什么 p 值不是"H₀ 为真的概率"吗? □ 我能至少说出两个伪相关例子吗? □ 我能用"幸存者偏差"和"辛普森悖论"来分析一篇商业报告吗? 如果五个都打勾,你已经准备好了。明天见。

系统化商业技能训练 · 20天 · 6章 · 免费开放