平均值会骗你
分布的形状比平均数重要
偏斜分布 · 中位数 vs 平均值先看你自己库里 5392 只 A 股过去一年的真实收益:
同一批股票、同一段时间,两个「平均」的说法差了十几个百分点。哪个更接近你的真实体验?中位数。
为什么会这样
A股近一年收益率分布
横轴为收益率区间,纵轴为股票数量
看这个形状:左边堆着一大团,右边拖出一条长长的尾巴。往下最多亏 100%,往上却可以涨 620.4%。
下跌有地板,上涨没天花板。少数暴涨股把平均值硬生生拉了上来,但绝大多数股票根本没参与这个过程。
只有 30.9% 的股票跑赢了平均值。换句话说,你随便买一只,有近七成概率跑输「平均」。
这改变三个判断
- 「去年 A 股平均跌了 0.8%,还行」——这句话是错的。典型的持有体验是亏 15.4%。
- 4.9% 的股票(262 只)翻倍,撑起了整个市场的账面收益。错过这一小撮,你的结果和「市场平均」就没有关系。这也解释了为什么长期看指数难被战胜——它不会漏掉它们。
- 分散持仓不是「求稳」,是数学必需。如果收益均匀分布,买 3 只和买 30 只期望一样。但在这种极度偏斜的分布里,买得太少,大概率完美避开那少数赢家。
换个市场看看
同期美股 10543 只:平均 18.6%,中位数 5.1%。绝对水平比 A 股好得多,但平均值高于中位数的偏斜结构完全一致——这不是 A 股的特色,是股票市场的普遍形态。
插一段:我第一次算错了
这个美股数字,我第一次算出来是「平均 +678.5%、中位数 0.0%」。我没有直接写进课文,因为它明显不合常理——一整个市场一年平均涨近七倍,不可能。
去查,发现是两个数据问题:
- 除数接近零。美股有大量 OTC 仙股起始价是 0.0001 之类,拿它做分母,收益率会炸成天文数字——最极端的一只算出 +4259900%,仅这一只就能把全市场平均值拉高几十个百分点。
- 僵尸股伪造出「零收益」。近 10% 的美股票根本不交易,首尾价格完全相同,贡献了一堆假的 0%,把中位数硬压到了 0.0%。
加两道过滤——起始价至少 1 美元、一年内至少有 120 个交易日——数字才变成上面那个合理的版本。
值得注意的是发现它的方式:不是检查代码检查出来的,而是「这个数看着不对劲」。而能产生这种警觉,靠的正是对分布形状的直觉——也就是这一课在讲的东西。统计素养的第一个用处,是让你察觉自己算错了。
记住这条
看到「平均」两个字,先问:分布对称吗?如果不对称,中位数才是典型情况,平均值只是被少数极端值绑架的结果。
这条规则不只用于股票——平均工资、平均房价、平均寿命,全都适用。
留给你的问题
上面这个算法藏着一个漏洞:我只统计了
今天还在你库里的股票。这一年里退市摘牌的公司,一只都没算进去。把它们加回来,这个 -15.4% 会变成多少?