Калькулятор проверки гипотез по z и t
Ваши данные
Выберите направление до того, как посмотрите на данные, а не после. Решение проверять только «больше» потому, что измеренное среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие.
Результаты
Как часто различие не меньше этого возникало бы по одной лишь случайности, если бы истинное среднее равнялось именно опорному значению
—
| Статистика критерия | — |
| По какому распределению это читается | — |
| Число степеней свободы | — |
| Значение, которое статистика должна превзойти | — |
| Насколько велико различие, в стандартных отклонениях | — |
| Что ответило бы другое распределение | — |
| Диапазон, с которым совместимо истинное среднее | — |
То же различие, измеренное на большем числе людей
| Наблюдения | Статистика критерия | Как часто это сделала бы одна случайность | Вывод |
|---|
В этой таблице в самом различии не меняется ничего. Среднее, опорное значение и отклонение остаются ровно там, куда вы их поставили, растёт только число наблюдений. И всё же вывод переворачивается на полпути, потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велика сама вещь. Поэтому размер различия стоит в таблице выше, рядом с ответом.
Другая строка, которую стоит прочесть, — сравнение двух распределений. Когда отклонение оценено по выборке, а не известно заранее, честным оказывается распределение Стьюдента, и оно строже нормального именно потому, что должно учесть: само отклонение — догадка. На малых выборках разрыв достаточен, чтобы перевернуть вывод, и закрывается он медленно: даже при ста наблюдениях они расходятся в третьем знаке после запятой.
Одного это число не означает, как бы часто его так ни описывали: это не вероятность того, что опорное значение истинно. Оно вычисляется в предположении, что значение истинно, и отвечает на вопрос, насколько удивительными были бы ваши данные. Чтобы перевернуть это, нужно то, чего одни данные дать не могут, — насколько правдоподобным значение было до всяких измерений.
Что использовать: z-критерий или t-критерий?
Используйте t-критерий всякий раз, когда стандартное отклонение получено из той же выборки, которую вы проверяете, — а это почти всегда. Берите z только тогда, когда отклонение действительно известно заранее для всей совокупности, из долгой истории того же измерения, а не из этих наблюдений.
Больше всего это важно на малых выборках. При одной и той же статистике 2,10 и двустороннем критерии распределение Стьюдента при пяти наблюдениях даёт 0,1037, а нормальное — 0,0357: одно называет это находкой на уровне 5%, другое нет. Согласие наступает примерно с двадцати наблюдений, и даже при ста они всё ещё расходятся в третьем знаке.
| Наблюдения | p по Стьюденту | p по нормальному |
|---|---|---|
| 5 | 0.1037 | 0.0357 |
| 8 | 0.0739 | 0.0357 |
| 10 | 0.0651 | 0.0357 |
| 15 | 0.0543 | 0.0357 |
| 20 | 0.0493 | 0.0357 |
| 30 | 0.0445 | 0.0357 |
Что на самом деле означает p-значение?
Это то, как часто различие не меньше вашего возникало бы по одной лишь случайности в мире, где опорное значение и есть истинное среднее. И только.
Это не вероятность того, что опорное значение истинно, и не вероятность того, что ваш результат был случайностью. Оба прочтения распространены и оба неверны: расчёт начинается с допущения, что опорное значение истинно, а потому никогда не скажет, насколько вероятным было само это допущение.
Почему мой результат стал значимым, когда я собрал больше данных?
Потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велико различие. Стандартная ошибка убывает как корень из числа наблюдений, поэтому то же самое различие даёт большую статистику всякий раз, когда выборка растёт.
Различие в четверть стандартного отклонения даёт 0,4495 при десяти наблюдениях, 0,0576 при шестидесяти, 0,0141 при ста и 0,0005 при двухстах. Само различие не изменилось ни разу. Поэтому его размер, посчитанный в стандартных отклонениях, стоит на этой странице рядом с ответом.
| Наблюдения | p-значение | Значимо на уровне 5% |
|---|---|---|
| 10 | 0.449524 | no |
| 30 | 0.181415 | no |
| 60 | 0.057602 | no |
| 100 | 0.014063 | yes |
| 200 | 0.000506 | yes |
| 500 | 0.000000 | yes |
Может ли значимый результат всё равно быть неважным?
Да, и на больших выборках это происходит постоянно. Значимо означает, что различие трудно объяснить случайностью, а не что оно достаточно велико, чтобы действовать.
Лекарство, снижающее давление на сотую долю пункта, окажется значимым, если испытать его на достаточном числе людей, и бесполезным в любом случае. Сначала читайте размер различия, и только потом p-значение.
Какой уровень значимости выбрать?
5% — общепринятая условность в большинстве областей, но это условность, а не закон, и выбирать её надо до того, как вы увидели данные, а не после.
Понижайте его, когда ложная тревога дорога, — например, в решении, которое трудно отменить. Повышайте, когда хуже пропустить настоящий эффект, — например, в дешёвом отсеве, который позже перепроверят.
Что меняет односторонний критерий?
Он кладёт весь допуск на одну сторону, поэтому для объявления различия в названном вами направлении нужно меньше свидетельств, а в противоположном — вообще никаких.
Это работает, только если вы называете направление до того, как посмотрели. Решение проверять лишь «больше» потому, что среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие, и он удваивает ту частоту ложных тревог, на которую вы рассчитываете.
Реакции
0
0 Комментарии
Прокомментируйте первым