被删掉的失败者
幸存者偏差,以及它到底有多大
幸存者偏差 · 样本选择上一课的数据只包含今天还在交易的股票。我把过去一年 A 股退市的 27 只补了回来,它们的成绩是:
部分退市股(按收益排序)
| 代码 | 名称 | 退市日 | 区间收益 |
|---|
| 920305.BJ | 云创退 | 20260730 | -97.8% |
| 300029.SZ | 天龙退 | 20260710 | -97.7% |
| 002898.SZ | 赛隆退 | 20260717 | -97.5% |
| 605081.SH | 退市太和 | 20260703 | -96.8% |
| 600193.SH | 退市创兴 | 20260706 | -96.2% |
| 600421.SH | 退市华嵘 | 20260626 | -96.1% |
加回来之后,结果变了多少
中位数只从 -15.4% 变成 -15.6%——几乎没动。这个结果和你可能的预期相反,但它恰恰是这一课最重要的部分。
为什么这次影响这么小
因为 A 股退市率很低:27 只 ÷ 五千多只 ≈ 每年 0.5%。样本里 0.5% 的极端值,动不了中位数。
幸存者偏差的大小 = 消失比例 × 消失者与幸存者的差距。这次第二项极大(-92.7% vs -15%),但第一项太小,乘起来就不显著。
那什么时候它会致命
- 时间拉长。一年 0.5%,十年就是 5% 以上,且复利累积——回测跨度越长,偏差越大。
- 换个市场。美股退市/摘牌率远高于 A 股,你库里 24748 只美股中有相当一部分已是无数据的空壳。
- 换个筛选口径。如果你专门研究「连续三年高增长的公司」,那些增长断掉、随后退市的样本被剔得干干净净,剩下的全是幸存者——这时偏差可能翻好几倍。
这正是你那套快速增长股筛选要警惕的地方:「通过多年一致性验证」这个条件本身,就是一道强力的幸存者过滤网。
记住这条
看到任何历史统计,先问一句:
「这里面,那些失败了、消失了的样本,还在不在?」再问第二句:它们占多大比例?
留给你的问题
你库里 A 股有 26.8% 被分类为「快速增长型」。听起来不少。但如果我说其中真正能持续的只是一小部分,你该怎么判断这个「一小部分」是多少才合理?