沉默的证据:幸存者偏差在投资书里的规模
- 理解「沉默的证据」为什么系统性地扭曲我们对成功因素的判断
- 认出投资领域里最严重的几处幸存者偏差
- 用「分母在哪」这个追问恢复被隐藏的样本
塔勒布在《黑天鹅》里引用过一个古老的故事,出自西塞罗的记载。
有人带着一位怀疑者参观神庙,指着墙上挂满的还愿画说:你看,这些都是向神祈祷后从海难中获救的人留下的,这证明了神的力量。
怀疑者问:那些祈祷了但淹死的人的画,挂在哪里?
这就是"沉默的证据":那些没能留下记录的样本,恰恰是判断因果关系所必需的。
一、为什么这个偏差特别难对付
因为缺失的东西不会举手告诉你它缺失了。
一个错误的数字,你可能核对出来。而一个不在你视野里的样本,你连它存在过都不知道。
你只能通过主动追问"分母在哪"来发现它。
而这个追问需要刻意的努力——默认状态下,人只会分析眼前有的东西。
二、投资领域的几处重灾区
重灾区一:成功者的方法论
一位成功的投资者写书讲述他的方法:集中持仓、逆向操作、长期坚持、在别人恐惧时贪婪。
这些叙述的问题不在于内容,在于样本。
问题是:有多少人用了完全相同的方法,然后失败了?
- 集中持仓的人里,有多少集中在了错误的标的上?
- 逆向操作的人里,有多少逆向到了一个真正在衰落的东西上?
- "在别人恐惧时贪婪"的人里,有多少在下跌途中耗尽了资金?
这些人不会写书,所以他们的方法不会被记录。
结果是:我们看到的所有方法论,都是从赢家那里收集的——而这个样本无法告诉我们这些方法的成功率。
更麻烦的一层:如果一个方法的特点是"高方差"(大成或大败),那么它必然会产生一些极其成功的案例。而这些案例的存在,不构成这个方法有效的证据。
重灾区二:晒出来的收益
社群里晒出来的收益是被双重筛选的:
第一重:赚了的人晒,亏了的人沉默。 第二重:即使是晒的人,晒的通常也是他最好的那一笔,而不是整体账户。
一个整体亏损的人,完全可以晒出一笔翻倍的交易。
重灾区三:指数和历史数据
这是一个技术性但很重要的问题。
一个长期存在的股票指数,其成分股是会调整的——衰落的、退市的、被并购的公司会被移出。
这意味着指数的长期历史,某种程度上记录的是"持续存在的那批公司"的表现。
同样,"某类资产的长期年化收益"这类统计,也可能没有包含那些消失了的对象。
实用含义:任何基于长期历史数据的乐观结论,都值得问一句——那些消失了的,进入统计了吗?
重灾区四:策略回测
这一处的幸存者偏差有多种形式:
- 测试数据里不包含已退市的标的 → 结果被系统性高估
- 策略是在同一批数据上反复调试出来的 → 你看到的是"在这批数据上表现最好的那个版本",而那些被淘汰的版本不会出现在最终报告里
- 公开的策略是从大量尝试中筛选出来的 → 分母(所有尝试过的策略)不可见
最后一条尤其值得注意:如果有人尝试了一千个策略,展示了表现最好的那个,那么这个策略的优秀表现可能纯粹来自筛选。
见 代表性偏差与小数定律。
重灾区五:基金业绩统计
一个具体的机制:表现差的基金可能被清盘或合并,从而退出统计样本。
结果是:现存基金的平均业绩,会高于"所有曾经存在过的基金"的平均业绩。
实用含义:看到"某类基金的平均收益是 X%"时,值得问一句——这个平均是在哪个样本上算的?
三、一个通用的追问
对付沉默的证据,只需要一个问题,但要养成习惯:
「分母在哪?」
具体化成几个版本:
- 看到一个成功案例 → 有多少人做了同样的事?其中成功的比例是多少?
- 看到一个方法论 → 用这个方法失败的人在哪里?
- 看到一组统计数据 → 哪些样本没有被包括进来?为什么?
- 看到一个策略回测 → 在得到这个版本之前,尝试并放弃了多少个版本?
这个追问大多数时候得不到精确答案——你确实无法知道有多少人失败了。
但光是意识到分母很大、且不可见,就足以把过度乐观的判断拉回来一大截。
四、几个实用的推论
推论一:警惕"从大量案例中总结的成功要素"
如果一项研究考察了一百家成功企业,找出它们的共同点——这个方法本身有结构性缺陷。
因为它没有考察那些具备同样特点但失败了的企业。
如果那些特点在失败者中同样普遍,那么它们就不具有解释力。
正确的做法需要对照组,而对照组恰恰是最难获得的。
推论二:高方差方法必然产生耀眼的案例
这是一个纯数学的事实。
任何一个高波动的方法,只要有足够多的人在用,就必然会产生一些极其成功的案例——即使这个方法的期望值是负的。
所以"有人用这个方法取得了巨大成功"这件事,本身几乎不提供任何信息。
判别方法:问一句——如果一万个人用这个方法,结果的分布会是什么样? 而不是只看那个成功者。
推论三:你自己的成功也可能是沉默证据的另一面
这一条最难接受,但最有价值。
如果你的方法目前有效,你应该问:在其他的可能路径上,这个方法会怎样?
你现在的成功,可能是因为方法有效,也可能是因为你恰好走在了那条幸运的路径上。
区分方法只有一个:看你的决策依据是否成立,而不是看结果。 见 过程 vs 结果 里的四格表——③"判断错但赚了"这一格,就是你自己身上的幸存者偏差。
推论四:主动去找失败案例
既然失败案例不会自己出现,那就主动寻找。
站内的案例库有一部分价值就在这里——见 LTCM 覆灭、原油宝负油价、光大乌龙指。这些是被记录下来的失败,而大部分失败没有被记录。
读失败案例的信息密度,通常高于读成功案例——因为失败的原因往往更具体、更可辨认,而成功的原因中混杂了大量运气。
本节要点
- 「溺水者的还愿画」:那些祈祷了但淹死的人的画挂在哪里? 沉默的证据是判断因果关系所必需、却系统性缺失的样本。
- 它特别难对付,因为缺失的东西不会举手告诉你它缺失了——你只能通过主动追问来发现它,而默认状态下人只分析眼前有的东西。
- 五处重灾区:成功者的方法论(用同样方法失败的人不会写书;且高方差方法必然产生一些极其成功的案例,这不构成方法有效的证据)、晒出来的收益(双重筛选:赚的才晒 + 晒最好的那一笔)、指数与历史数据(衰落退市的公司被移出)、策略回测(不含退市标的、同批数据反复调试、公开的策略是从大量尝试中筛选出来的)、基金业绩统计(表现差的被清盘从而退出样本)。
- 通用追问:「分母在哪?」 ——有多少人做了同样的事?失败的人在哪里?哪些样本没被包括?在这个版本之前放弃了多少个版本?大多数时候得不到精确答案,但意识到分母很大且不可见,就足以把过度乐观拉回一大截。
- 四个推论:警惕"从大量成功案例总结的要素"(没有对照组;如果那些特点在失败者中同样普遍,它们就没有解释力)、高方差方法必然产生耀眼案例(问"如果一万个人用这个方法,结果分布会怎样")、你自己的成功也可能是幸运路径(四格表里的 ③ 就是你身上的幸存者偏差)、主动去找失败案例(读失败的信息密度通常高于读成功,因为失败原因更具体可辨认)。
本文为投资通识教育内容,不构成任何投资建议。