统计与判断力

被删掉的失败者

幸存者偏差,以及它到底有多大
幸存者偏差 · 样本选择

上一课的数据只包含今天还在交易的股票。我把过去一年 A 股退市的 27 只补了回来,它们的成绩是:

退市股收益中位数
-92.7%
最差
-97.8%
跌超50%的占比
85.2%
部分退市股(按收益排序)
代码名称退市日区间收益
920305.BJ云创退20260730-97.8%
300029.SZ天龙退20260710-97.7%
002898.SZ赛隆退20260717-97.5%
605081.SH退市太和20260703-96.8%
600193.SH退市创兴20260706-96.2%
600421.SH退市华嵘20260626-96.1%

加回来之后,结果变了多少

只算幸存者
-15.4%
补回退市股
-15.6%
中位数只从 -15.4% 变成 -15.6%——几乎没动。这个结果和你可能的预期相反,但它恰恰是这一课最重要的部分。

为什么这次影响这么小

因为 A 股退市率很低:27 只 ÷ 五千多只 ≈ 每年 0.5%。样本里 0.5% 的极端值,动不了中位数。

幸存者偏差的大小 = 消失比例 × 消失者与幸存者的差距。这次第二项极大(-92.7% vs -15%),但第一项太小,乘起来就不显著。

那什么时候它会致命

  1. 时间拉长。一年 0.5%,十年就是 5% 以上,且复利累积——回测跨度越长,偏差越大。
  2. 换个市场。美股退市/摘牌率远高于 A 股,你库里 24748 只美股中有相当一部分已是无数据的空壳。
  3. 换个筛选口径。如果你专门研究「连续三年高增长的公司」,那些增长断掉、随后退市的样本被剔得干干净净,剩下的全是幸存者——这时偏差可能翻好几倍。
这正是你那套快速增长股筛选要警惕的地方:「通过多年一致性验证」这个条件本身,就是一道强力的幸存者过滤网。
记住这条
看到任何历史统计,先问一句:「这里面,那些失败了、消失了的样本,还在不在?」再问第二句:它们占多大比例?
← 第1课目录第3课 →