正态、二项与泊松,以及拿一个替另一个要付的代价

正态分布

在固定次数中出现的次数

这里的尾部是直接用互补误差函数算的,而不是用一减去另一个;正是这一点,才让四五个标准差不会塌成一个四舍五入后的零。

结果

这离均值有几个标准差
落在它以下的概率
落在它以上的概率

这个次数,精确的与近似的

不超过该次数的精确概率
恰好为该次数的精确概率
正态曲线,不做连续性校正
它偏了多少,百分比
正态曲线,加上校正
它偏了多少,百分比
泊松,把均值设成同一个数
它偏了多少,百分比

人人都学过的规则是:只要平均次数达到五,就可以用正态曲线来代替计数。恰恰在这个边界上,二十次试验、每次百分之二十五时,精确答案是 0.091260,而未校正的曲线说是 0.060668。就在它被宣布安全的那一点上,它错了三分之一。

连续性校正不是锦上添花,它就是精度的大部分。读曲线之前加上半个单位,同样的数字、不需要任何额外信息,就把负百分之三十三的误差变成正七点八。不做校正就用近似的人,是在选择错得比近似本身的代价还多。

近似从哪里开始变得诚实

试验次数平均次数精确校正后曲线的误差,百分比

每一行问的都是“比均值低三个”的同一个问题,所以随着试验次数增加,比较是公平的。误差从大约百分之八降到大约百分之零点五——这才是那条规则真正的形状:不是一道跨过去的门槛,而是一段走下去的坡。

结果里的第三行是另一种近似,弱点也不同。泊松替代计数的条件是每次的概率很小,而不是试验次数很多:在百分之二十五时它差了百分之三十六,而在一千次试验、每次百分之一时,只差三分之一个百分点。

所以并不存在一个“就是更好”的近似。一个需要试验次数很多,另一个需要每次概率很小,而精确答案两者都不需要——这正是本页选择直接算它、而不是去够一条曲线的原因。

反应

0

0 评论

User profile image

成为第一个发表评论的人

什么时候可以用正态曲线代替精确计数?

人人都学的规则要求平均次数达到五。恰恰在这个边界上,未校正的曲线错了三分之一——对一道门槛来说,这有点奇怪。

这张表展示的是随着试验次数增加,实际发生的事。误差是逐渐下降的,而不是在某条线上被关掉;所以诚实的读法是一段坡,不是一道门槛。

试验次数平均次数校正后曲线的误差,百分比
205,0+7,77
5012,5-2,05
10025,0-1,58
20050,0-1,23
500125,0-0,78
1000250,0-0,54
什么是连续性校正,它要紧吗?

就是在读曲线之前加上半个单位,因为计数只落在整数上,而曲线不是。它不花任何代价,却贡献了大部分精度。

按本页起始的数字,它把负百分之三十三的误差变成正七点八。不用它就用近似,等于选择错得比近似本身的代价还多。

什么时候泊松才是对的那个近似?

当每次的概率很小时——这和“试验次数很多”是两回事。在百分之二十五时,无论试验多少次,它都差百分之三十六。

把同样的一千次试验改成每次百分之一,误差就降到三分之一个百分点。两种近似朝不同方向出错,这正是没有哪一个“就是更好”的原因。

到底为什么还要算精确答案?

因为现在它很便宜。那些近似之所以存在,是因为当年一项一项手算才是昂贵的部分,而这早就不成立了。

本页是用对数、一项一项地把它们加起来的,这样一千次试验也不会需要一个大到装不下的数。把那些近似留在屏幕上,是为了展示它们的代价,而不是因为需要它们。