📋 Day 15 · 实操任务
Day 15 实操任务清单
今日主题: 建模与量化决策——用回归、ANOVA、因素分析、聚类分析、决策树和蒙特卡洛模拟从数据中提取洞察 核心能力: 不是"会用软件跑模型"——是"知道在什么场景下用什么模型——以及模型输出的局限性" 面试关联: 投行/咨询/PE 的 Case Interview——建模能力是区分"能做分析"和"能做判断"的关键
任务一:回归分析——多元回归与共线性诊断(20分钟)
背景: 你是百威亚太的战略分析师——需要理解什么因素驱动各省级市场的啤酒销量。
数据:30 个省份的啤酒销量(百万箱/月)
解释变量:
X₁ = 人均可支配收入(元/月)
X₂ = 月平均气温(°C)
X₃ = 25-45岁人口占比(%)
X₄ = 餐饮业繁荣度指数(指数——0-100)
X₅ = 竞品促销力度(竞品在当地的广告投放——百万元/月)要求:
如果先跑一个相关系数矩阵——你预计哪两个变量之间的相关性最高?为什么?(提示:气温和什么相关?人均收入和什么相关?)
如果你把 5 个变量全部放进多元回归——发现 X₂(气温)的系数从单变量回归的 +2.3 降到了 +0.4——且不再显著。这说明什么?气温的"真实效果"被哪些变量"偷走"了?
计算 VIF(方差膨胀因子)——如果 X₁ 和 X₄ 的 VIF 都超过 8——你会怎么处理?去掉一个?合并?还是不做任何处理——但在汇报时注明?
面试级判断: CEO 问——"这个回归能告诉我——提高人均收入是拉动啤酒销量的方法吗?"——你怎么回答?(提示:回归系数告诉你"相关性"——但"提高人均收入"作为"政策工具"——你无法随机分配给各省——混淆变量太多——这是"描述"不是"处方"。)
任务二:ANOVA——比较四个品牌在不同渠道的表现(15分钟)
背景: 百威亚太在四个零售渠道追踪了品牌偏好指数(0-100):
渠道 A(高端超市——Ole'/CitySuper):12 个城市——均值 78——标准差 8
渠道 B(大众超市——永辉/大润发):15 个城市——均值 72——标准差 10
渠道 C(便利店——全家/罗森):10 个城市——均值 68——标准差 12
渠道 D(电商——天猫/京东):18 个城市——均值 74——标准差 15要求:
用直觉判断——ANOVA 的 F 统计量会显著吗?渠道 D(电商)的标准差(15)远大于渠道 A(8)——这对 ANOVA 意味着什么?
假设 ANOVA 显著——事后检验(Tukey HSD)发现:
- 渠道 A vs 渠道 C:显著(p < 0.01)
- 渠道 A vs 渠道 B:不显著(p = 0.08)
- 渠道 B vs 渠道 D:不显著(p = 0.45)
你应该建议把预算从哪个渠道转到哪个渠道?为什么"不显著"的结果和"显著"的结果一样重要?
面试级判断: 渠道 D 虽然均值不低(74)——但标准差最大(15)。从风险管理的角度——你怎么看待"高波动渠道"?这和投资组合中的"高风险资产"有什么共同点?
任务三:因素分析——理解啤酒消费的"隐形驱动力"(15分钟)
背景: 你收集了 50 个城市的 10 个啤酒消费相关指标——做了一个因素分析(使用 Varimax 旋转)——得到了 3 个因子:
因子 1(解释 35% 方差):
高载荷指标:人均可支配收入(0.89)、高端餐饮密度(0.85)、进口啤酒占比(0.78)
因子 2(解释 28% 方差):
高载荷指标:月均气温(0.91)、夜市繁荣度(0.83)、户外活动天数(0.76)
因子 3(解释 19% 方差):
高载荷指标:25-35岁人口占比(0.87)、外卖订单密度(0.72)、线上社交活跃度(0.68)要求:
给这 3 个因子各起一个"商业名称"——不是统计标签——是能让市场总监立刻理解的命名。
如果百威亚太在"因子 1"上得分最高、在"因子 2"上得分中等、在"因子 3"上得分最低——这对百威的高端化战略意味着什么?应该把资源投在哪个因子上?
面试级判断: 因子分析的结果依赖于旋转方法(Varimax vs Promax vs 不旋转)。如果有人质疑你的因子命名——说"换个旋转方法——因子载荷就完全不一样了——你的'消费升级因子'可能根本不存在"——你怎么回应?
任务四:决策树——百威亚太的新市场进入决策(15分钟)
背景: 百威亚太考虑进入东南亚某新兴市场。你画出决策树:
┌── 成功(p=55%)── NPV = +800M USD
进入市场 ────┤
(成本-150M) └── 失败(p=45%)── NPV = -350M USD(含退出成本)
不进入 ──── NPV = 0要求:
计算"进入市场"的期望 NPV。和"不进入"(NPV=0)比较——应该进入吗?
如果可以先做一个"试点"(成本 30M——持续 1 年)——试点成功后——再决定是否全面进入(此时成功概率更新为 80%——因为有试点数据)——试点失败——放弃(损失只限于试点成本)。试点的"成功概率"和原决策树的"成功概率"相同(55%)。计算"先试点"策略的期望 NPV。(提示:这是一个两阶段决策树——试点成功→进入→80%成功/20%失败——试点失败→放弃→-30M。)
面试级判断: 决策树给你期望值——但真实世界中——你只会做一次决策——不会做 100 次取平均。期望值在"一次性决策"中有什么局限性?你怎么向 CEO 传达这种局限性?
任务五:蒙特卡洛模拟——DCF估值的不确定性量化(15分钟)
背景: 你在给百威亚太做 DCF 估值——有三个关键假设的不确定性很大:
假设 1:永续增长率 g
→ 分布:Normal(2.0%, 0.5%)——在 0.5% 到 3.5% 之间
假设 2:WACC
→ 分布:Normal(8.5%, 1.0%)——在 5.5% 到 11.5% 之间
假设 3:第 5 年 EBITDA 利润率
→ 分布:Normal(35%, 3%)——在 26% 到 44% 之间要求:
传统"点估计":g=2%, WACC=8.5%, 利润率=35% → DCF = 850 亿 HKD。为什么这个"850 亿"可能给人虚假的精确感?
如果你不能实际运行蒙特卡洛模拟(没有软件)——怎么做"手动版"的敏感性分析来传达不确定性?(提示:做一个 3×3 表格——g 取 {1%, 2%, 3%}——WACC 取 {7.5%, 8.5%, 9.5%}——计算 9 个估值——看范围。)
面试级判断: 有人批评蒙特卡洛模拟——"输入的是垃圾分布——输出的也是垃圾分布——给假设穿上概率的外衣——不改变假设的质量"。你同意吗?蒙特卡洛模拟的真正价值是什么?
检查清单
| 任务 | 完成 | 用时 |
|---|---|---|
| 任务一:回归分析——共线性诊断 | □ | ___ min |
| 任务二:ANOVA——渠道比较 | □ | ___ min |
| 任务三:因素分析——隐形驱动力 | □ | ___ min |
| 任务四:决策树——市场进入 | □ | ___ min |
| 任务五:蒙特卡洛——不确定性量化 | □ | ___ min |
今日深度阅读(完成任务后阅读)
深度阅读25_贝叶斯思维在投资中的应用.md深度阅读26_行为金融学与统计陷阱.md
Day 15 · 建模与量化决策 · 2026-08-12