先看两个均值相同的教学盒
假设模型:盒A里有十张等可能纸签,其中五张写着0,五张写着2;盒B里有九张写着0,一张写着10。每次独立随机抽一张,抽签后放回;每张纸签始终等可能。表中的频数和中位数来自盒内十张纸签的完整数列,不是抽十次得到的样本。
| 模型 | 可能结果 | 平均值 | 中位数 |
|---|---|---|---|
| 盒A | 0(五张)、2(五张) | (0×5+2×5)÷10=1 | 1 |
| 盒B | 0(九张)、10(一张) | (0×9+10×1)÷10=1 | 0 |
两盒的平均值都是1,但典型结果并不一样。盒A抽到0或2的机会各为百分之五十;盒B有百分之九十的机会抽到0,只有百分之十的机会抽到10。因此,盒A的结果较常落在平均值附近,而盒B的平均值主要由少数较大的结果拉高。
逐步计算方差与标准差
方差可以理解为各结果偏离平均值的平方离差的平均数。先计算盒A:结果0与平均值1的差是−1,平方为1;结果2与平均值1的差是1,平方也是1。两种结果各占一半,所以方差为(1×5+1×5)÷10=1,标准差为√1=1。
再计算盒B:结果0与平均值1的差是−1,平方为1;结果10与平均值1的差是9,平方为81。九张0贡献9×1,一张10贡献1×81,所以方差为(9+81)÷10=9,标准差为√9=3。
这里的标准差分别为1和3。数值越大,表示在这个完整定义的模型中,结果相对平均值的离散程度越高。盒B并不是平均返还更高,而是少数结果到平均值的距离特别大,使平方离差的平均数增大。两个盒抽到0时离均值都为1,不能说盒B的每一种结果都更偏离均值。
为什么只看平均数会遗漏信息
平均数把所有结果加总后再除以次数,能够描述总体的中心位置,却不会告诉我们结果集中还是分散,也不会告诉我们零值出现得多不多。盒A的零值频数是五张,盒B是九张;盒A的中位数为1,盒B的中位数为0。由此可见,盒B虽然均值为1,但至少一半以上的单次结果都没有积分。
“平均相同”也不等于“下一次会回到平均值”。在盒B中,前面连续抽到多张0,并不会改变下一张纸签仍有九成概率为0、百分之十概率为10的设定;在盒A中,连续结果也不会自动产生补偿。均值是对整个模型的汇总,不是对某一次结果的承诺。
把模型指标用于阅读时要设边界
标准差用于描述波动程度,相关用语见英国博彩委员会的返还表现监测术语说明。这只是术语来源,不表示英国标准自动适用于亚洲地区,也不表示任何具体平台符合其中要求。
标准差同样依赖定义和数据范围。上面的1与3来自十张纸签的完整模型,不是从几张截图、几次记录或零散真实结果估计出来的。现实数据还可能涉及观察期间、结果是否独立、投入与返还如何计数等问题;如果这些口径没有说明,直接比较两个标准差容易得到错误结论。
一个简明的识别清单
遇到“平均返还相同”的说法时,可以依次核对四点:第一,平均值是理论设定还是某段期间的实际统计;第二,结果的零值频数和中位数是否相近;第三,是否报告了方差或标准差,而不是只展示平均数;第四,样本量、统计期间和计算口径是否明确。若只给出平均值,最多能判断中心位置,不能判断结果起伏大小。
因此,盒A与盒B的正确比较不是“哪个更好”,而是“它们的离散结构不同”:盒A波动较小,盒B波动较大;盒B的较高结果由少数事件形成,不能被解释成稳定的高收益。这个区别正是识别波动、避免把高波动误读为高返还的基础。
