统计与判断力

多少样本才算数

小样本给出的,往往只是噪音
样本量 · 估计的不确定性

全市场 5391 只 A 股,过去一年真实的中位收益是 -13.1%。现在假装我不知道这个答案,只随机抽一部分来估计它,每种样本量重复 800 次:

不同样本量下,估计值的波动范围
竖线为 90% 的估计落点区间,横线为真实值
同一个真相,不同样本量给出的答案范围
样本量90%区间下限90%区间上限区间宽度
10 只-25.5%+5.1%30.6 个百分点
30 只-21.2%-3.5%17.7 个百分点
100 只-17.6%-8.4%9.2 个百分点
300 只-15.5%-10.3%5.2 个百分点
1000 只-14.4%-11.8%2.5 个百分点
只抽 10 只时,估计值有 90% 的概率落在一个 30.6 个百分点宽的区间里。换句话说,抽到 -30% 和抽到 0% 都很正常——而真相只有一个

四倍样本,一半误差

注意区间宽度的收缩速度:样本量从 10 到 1000(100倍),宽度从 30.6 收到 2.5 个百分点,只缩小了约 12 倍。

这是统计学最重要的一条经验规律:精度只随样本量的平方根提升。想把误差减半,样本量要翻四倍;想减到十分之一,要翻一百倍。

回到你自己的回测

你之前那个 A 股回测:每个批次 165~1121 只股票,一共 6 个时间点,结论是「6 个批次里只有 2 个跑赢基准」。

股票数量其实够(几百只时区间已经比较窄)。真正的短板是「6 个时间点」。在时间维度上,你的样本量是 6,不是 600——而市场风格的切换周期恰恰以年计。

6 个观测点里出现 2 胜 4 负,如果真实胜率是 50%,纯靠运气也很容易出现这个结果。这个回测能说明「没有证据表明它有效」,但不足以证明「它无效」。这两句话的差别很大。
记住这条
看到任何统计结论,先找样本量。然后问:如果真相恰好相反,我这个样本量看到当前结果的概率有多大?概率不低,就说明证据不足。
← 第5课目录第7课 →