📋 Day 14 · 实操任务
Day 14 实操任务清单
今日主题: 量化思维——用统计学和概率论在商业场景中做判断 核心能力: 不是"算对数字"——是"面对不确定时——用数学框架比直觉更可靠地做出判断" 面试关联: 投行/咨询/PE 的 Case Interview——至少一半在测试你用数字处理模糊问题的能力
任务一:描述性统计——"平均"这个词骗人(15分钟)
背景: 你是某消费 PE 的分析师——合伙人给你两家标的公司的 5 年收入数据——让你判断哪家"更稳定"。
公司 A(连锁火锅——海底捞):
近 5 年收入增速:+18%, +15%, -12%, +22%, +8%
公司 B(瓶装水——农夫山泉):
近 5 年收入增速:+9%, +8%, +10%, +7%, +11%要求:
计算两家公司的均值增速和中位数增速。哪家的均值更有意义——哪家的中位数更真实?为什么?
计算两家公司增速的标准差(用笔算——不用计算机——给近似值即可——重点是理解"标准差在说什么")。如果这两家公司是你的 PE 基金的潜在标的——你会给哪一家更高的"安全边际"要求——为什么?
面试级判断: 合伙人说"公司 A 平均增速 10.2%——不错"。你会怎么回应?(提示:-12% 那个年份发生了什么——这件事会不会再发生——你把"一次性的"从均值中拿掉后——"真实的均值"是多少?)
任务二:贝叶斯更新——把信念数字化(20分钟)
背景: 你在一家 VC——评估一个 AI SaaS 种子轮项目。
先验概率(行业基准):
→ 种子轮 AI SaaS 项目——能活到 A 轮且估值翻倍的概率 = 15%
信号 1:创始人是连续创业者(上一家公司被成功收购了)
→ P(连续创业者 | 成功项目) = 60%
→ P(连续创业者 | 失败项目) = 20%
信号 2:项目已经有 3 家付费企业客户(种子轮阶段——大多数项目还没有付费客户)
→ P(有付费客户 | 成功项目) = 45%
→ P(有付费客户 | 失败项目) = 10%
信号 3:创始团队中有技术大牛——曾在某顶级 AI 实验室担任核心研究员
→ P(技术大牛 | 成功项目) = 35%
→ P(技术大牛 | 失败项目) = 25%要求:
仅使用信号 1(连续创业者)——用贝叶斯定理更新"成功概率"——从 15% 更新到多少?(参照手册中的计算方法——写出步骤)
在信号 1 的基础上——再用信号 2(付费客户)做第二次更新——后验概率变成了多少?
再用信号 3 做第三次更新。最后的后验概率是多少?和最初的 15% 比——三个信号加起来把"成功概率"提升了几倍?
面试级判断: 信号 3(技术大牛)的"区分度"为什么远低于信号 1(连续创业者)和信号 2(付费客户)?看条件概率——P(技术大牛|成功) 和 P(技术大牛|失败) 的差距很小(35% vs 25%)。如果一个信号的"区分度"很低——把它加进贝叶斯更新里——你会得到什么结果?(提示:信号 3 几乎不改变后验概率——这就是"弱信号"的数学定义——在面试中说"我们需要区分'强信号'和'弱信号'"——会非常加分。)
实战应用: 你刚刚完成了对一家 PE 标的公司的尽调——你的"投资 thesis 成立的概率"从尽调前的 40%——经过三次贝叶斯更新后——变成了 65%。合伙人问你"你有多大把握"——你应该回答 65%——还是应该回答"这取决于我选择的先验概率和信号权重——如果换一个先验——结论可能不同"?为什么?
任务三:回归分析——找陷阱(15分钟)
背景: 某咨询公司向你展示了一份"啤酒销量驱动因素"的回归分析:
回归方程:啤酒销量(百万箱/月)= a + b₁ × 月平均气温 + b₂ × 人均可支配收入 + b₃ × 广告支出
结果:
b₁(气温系数)= +2.3——p = 0.001——"显著"
b₂(收入系数)= +0.05——p = 0.08——"不显著——但方向对"
b₃(广告系数)= +0.8——p = 0.04——"显著"
R² = 0.71要求:
气温和啤酒销量——这个关系很直观。但"气温"和"广告支出"之间有没有相关关系?如果啤酒公司倾向在夏天多投广告——这两个变量高度相关——回归中 b₁ 和 b₃ 会有什么问题?(提示:多重共线性——气温和广告的"效果"分不清——气温的系数可能被高估——广告的系数可能被低估——或者反过来。)
咨询公司说"人均可支配收入——p = 0.08——虽然不显著——但方向对——所以收入确实在推动啤酒销量。"你应该怎么回应?(提示:p = 0.08 意味着什么——如果零假设是真的——你有 8% 的概率看到这样的数据。但"方向对"不是统计推断——是愿望。)
R² = 0.71。解释这个数字——然后解释它为什么不能告诉你"气温导致了啤酒销量增长"(因果 vs 相关)。
面试级判断: 如果让你重新设计这个回归——你会加入什么变量(至少两个)——或改变什么——来更好地分离因果效应?
任务四:ANOVA——四条业务线——谁在拖后腿(15分钟)
背景: 百威亚太在中国四个大区的季度销量增速数据:
华东区(12 个季度):均值 +5.2%——标准差 2.1%
华南区(12 个季度):均值 +4.8%——标准差 1.8%
华西区(12 个季度):均值 +2.1%——标准差 3.5%
华北区(12 个季度):均值 +3.5%——标准差 2.4%要求:
用直觉先判断——如果做 ANOVA——F 统计量会显著吗?为什么华西区的标准差(3.5%)让你担心?(提示:方差齐性——ANOVA 假设各组方差大致相等——华西区的波动几乎是华南区的 2 倍——可能需要 Welch ANOVA。)
假设 ANOVA 显著(p < 0.01)——事后检验(Tukey HSD)的结果可能是怎样的?(哪对大区之间可能有显著差异——哪对可能没有?)
统计显著 vs 商业显著: 华东区(5.2%)vs 华南区(4.8%)——差异 0.4 个百分点。如果样本量足够大——这个差异可能是"统计显著"的。但从商业决策的角度——你会把华东区定为"优秀"——华南区定为"合格"吗?如果华南区的市场基数远大于华东区——总量贡献更大——你怎么平衡"增速"和"体量"?
面试级判断: 华西区增速最低(2.1%)——但标准差最大(3.5%)。这意味着华西区有"高波动+低均值"的特征。这和 PE/VC 中的什么概念类似?(提示:期望值低 + 方差大 = "回报的分布对你最不利的象限"——你想逃离这种资产——而不是投入更多。)
任务五:聚类分析 + 因素分析——从数据到策略(15分钟)
背景: 你收集了 30 家全球消费品公司的数据——每家 6 个指标:收入增速、毛利率、净利率、ROE、资产负债率、研发费用率。你用 PCA 降维——前 2 个主成分解释了 78% 的方差。然后你用 K-means 聚类(K=3)——得到了三个簇。
簇 1(8 家公司):高毛利率(60%+)——中速增长——低杠杆——高 ROE
簇 2(12 家公司):中毛利率(30-45%)——高速增长——中杠杆——中 ROE
簇 3(10 家公司):低毛利率(15-25%)——低速增长——高杠杆——低 ROE要求:
给这三个簇各起一个"商业名称"(不是统计标签——是战略描述——比如"品牌复利型")。每个簇对应现实中的什么公司类型?
如果 PCA 的前 2 个主成分解释了 78% 的方差——"剩下的 22%"代表什么?如果用这 2 个主成分代替 6 个原始指标做聚类——你会丢失什么信息——这个丢失可接受吗?
如果其中一家公司("百威亚太")——在簇 1 和簇 2 的"边界"上——两个簇的中心离它差不多远。你应该把它分配给哪个簇?这在实际应用中意味着什么?(提示:K-means 强制分配——每家必须属于某一个簇——即使它"其实不真正属于任何一个"——这是聚类分析的局限——不是 bug——但你必须知道。)
面试级判断: 你把这个分析交给 CEO——CEO 看了之后问——"所以这三个簇告诉了我什么——我不知道的事情?"——你的回答应该是什么?
检查清单
| 任务 | 完成 | 用时 |
|---|---|---|
| 任务一:描述性统计——"平均"骗人 | □ | ___ min |
| 任务二:贝叶斯更新——信念数字化 | □ | ___ min |
| 任务三:回归分析——找陷阱 | □ | ___ min |
| 任务四:ANOVA——谁在拖后腿 | □ | ___ min |
| 任务五:聚类+因素分析——数据到策略 | □ | ___ min |
今日深度阅读(完成任务后阅读)
深度阅读25_贝叶斯思维在投资中的应用.md深度阅读26_行为金融学与统计陷阱.md
Day 14 · 概率统计与推断基础 · 2026-08-12