假设检验计算器(z 与 t)
您的数据
在看数据之前就把方向定下来,而不是看完再定。因为量出来的平均值恰好偏高,就只往高的一边检验,这是把抛硬币变成发现的最老办法。
结果
如果真实平均值恰好就是你对照的那个值,仅靠偶然出现至少这么大的差异会有多频繁
—
| 检验统计量 | — |
| 对着哪个分布来读 | — |
| 自由度 | — |
| 统计量必须越过的值 | — |
| 这个差异有多大,用标准差来数 | — |
| 另一个分布会给出什么答案 | — |
| 与真实平均值相容的区间 | — |
同一个差异,测在更多人身上
| 观测数 | 检验统计量 | 仅靠偶然会有多频繁做到 | 结论 |
|---|
在那张表里,关于这个差异的一切都没有变。平均值、对照值和标准差都留在你放它们的地方,只有观测数在长。可是判定却在半路上翻了过来,因为检验量的是你测得多好,而不是这件事有多大。这就是为什么差异的大小放在上面那张表里,紧挨着答案。
另一行值得读的,是比较两个分布的那一行。当标准差是从样本估出来、而不是事先就知道时,学生 t 分布才是老实的那个;它比正态分布更苛刻,恰恰因为它必须把「标准差本身也是猜的」算进去。样本小的时候,这段差距足以翻转判定,而且它收拢得很慢:哪怕有一百个观测,两者仍在小数点后第三位分道扬镳。
尽管常被那样描述,这个数字有一件事并不是:它不是「你对照的那个值为真」的概率。它的算法是先假定那个值为真,再问你的数据会有多令人意外。要把这件事反过来,需要数据本身给不了的东西,也就是在你测量任何东西之前,那个值有多可信。
我该用 z 检验还是 t 检验?
只要标准差来自你正在检验的那份样本,就用 t 检验——几乎总是如此。只有当标准差确实是事先就对整个总体已知的,来自同一测量的长期历史而不是这批观测时,才用 z。
样本小的时候这件事最要紧。同样是 2,10 的统计量、同样是双侧检验,五个观测时 t 给出 0,1037,正态给出 0,0357:一个在 5% 上称之为发现,另一个不称。大约二十个观测以后两者才一致,即使到了一百个,它们仍在小数点后第三位有出入。
| 观测数 | 按 t 分布的 p | 按正态分布的 p |
|---|---|---|
| 5 | 0.1037 | 0.0357 |
| 8 | 0.0739 | 0.0357 |
| 10 | 0.0651 | 0.0357 |
| 15 | 0.0543 | 0.0357 |
| 20 | 0.0493 | 0.0357 |
| 30 | 0.0445 | 0.0357 |
p 值到底是什么意思?
它是说:在一个「参考值就是真实平均值」的世界里,仅靠偶然出现至少和你一样大的差异会有多频繁。仅此而已。
它不是「参考值为真」的概率,也不是「你的结果是碰巧」的概率。这两种读法都很常见,而且都是错的,因为计算一开始就假定参考值为真,所以它永远无法告诉你这个假定本身有多可能。
为什么我多收集了数据以后,结果就变显著了?
因为检验量的是你测得多好,而不是差异有多大。标准误差随观测数的平方根缩小,所以样本每变大一次,同样的差异就产生更大的统计量。
四分之一个标准差的差异,在十个观测时给出 0,4495,六十个时 0,0576,一百个时 0,0141,两百个时 0,0005。这个差异一次也没变过。这就是为什么本页把用标准差数出来的差异大小放在答案旁边。
| 观测数 | p 值 | 在 5% 上显著 |
|---|---|---|
| 10 | 0.449524 | no |
| 30 | 0.181415 | no |
| 60 | 0.057602 | no |
| 100 | 0.014063 | yes |
| 200 | 0.000506 | yes |
| 500 | 0.000000 | yes |
显著的结果还可能是不重要的吗?
会,而且在大样本里时常发生。显著的意思是这个差异难以用偶然来解释,而不是它大到值得据此行动。
一种把血压降低百分之一个点的药,只要在足够多的人身上试,就会是显著的,而且怎么说都没用。先读差异的大小,再读 p 值。
我该选哪个显著性水平?
5% 是多数领域的惯例,但那是惯例而不是法律,而且应该在看到数据之前就选好,而不是之后。
当误报代价高时就把它调低,比如一个很难撤回的决定。当漏掉真实效应才是更糟的错误时就把它调高,比如一道便宜的初筛,后面还会再查一遍。
单侧检验会改变什么?
它把全部容差都放到一边,所以在你指定的方向上宣布有差异所需的证据更少,而在相反方向上则完全不做宣布。
只有当你在看之前就把方向定下来,这才成立。因为平均值恰好偏高就只往高的一边检验,是把抛硬币变成发现的最老办法,而且会把你以为自己承担的误报率翻一倍。
反应
0
0 评论
成为第一个发表评论的人