Калькулятор проверки гипотез по z и t

Ваши данные

Выберите направление до того, как посмотрите на данные, а не после. Решение проверять только «больше» потому, что измеренное среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие.

Результаты

Как часто различие не меньше этого возникало бы по одной лишь случайности, если бы истинное среднее равнялось именно опорному значению

Статистика критерия
По какому распределению это читается
Число степеней свободы
Значение, которое статистика должна превзойти
Насколько велико различие, в стандартных отклонениях
Что ответило бы другое распределение
Диапазон, с которым совместимо истинное среднее

То же различие, измеренное на большем числе людей

НаблюденияСтатистика критерияКак часто это сделала бы одна случайностьВывод

В этой таблице в самом различии не меняется ничего. Среднее, опорное значение и отклонение остаются ровно там, куда вы их поставили, растёт только число наблюдений. И всё же вывод переворачивается на полпути, потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велика сама вещь. Поэтому размер различия стоит в таблице выше, рядом с ответом.

Другая строка, которую стоит прочесть, — сравнение двух распределений. Когда отклонение оценено по выборке, а не известно заранее, честным оказывается распределение Стьюдента, и оно строже нормального именно потому, что должно учесть: само отклонение — догадка. На малых выборках разрыв достаточен, чтобы перевернуть вывод, и закрывается он медленно: даже при ста наблюдениях они расходятся в третьем знаке после запятой.

Одного это число не означает, как бы часто его так ни описывали: это не вероятность того, что опорное значение истинно. Оно вычисляется в предположении, что значение истинно, и отвечает на вопрос, насколько удивительными были бы ваши данные. Чтобы перевернуть это, нужно то, чего одни данные дать не могут, — насколько правдоподобным значение было до всяких измерений.

Реакции

0

0 Комментарии

User profile image

Прокомментируйте первым

Что использовать: z-критерий или t-критерий?

Используйте t-критерий всякий раз, когда стандартное отклонение получено из той же выборки, которую вы проверяете, — а это почти всегда. Берите z только тогда, когда отклонение действительно известно заранее для всей совокупности, из долгой истории того же измерения, а не из этих наблюдений.

Больше всего это важно на малых выборках. При одной и той же статистике 2,10 и двустороннем критерии распределение Стьюдента при пяти наблюдениях даёт 0,1037, а нормальное — 0,0357: одно называет это находкой на уровне 5%, другое нет. Согласие наступает примерно с двадцати наблюдений, и даже при ста они всё ещё расходятся в третьем знаке.

Наблюденияp по Стьюдентуp по нормальному
50.10370.0357
80.07390.0357
100.06510.0357
150.05430.0357
200.04930.0357
300.04450.0357
Что на самом деле означает p-значение?

Это то, как часто различие не меньше вашего возникало бы по одной лишь случайности в мире, где опорное значение и есть истинное среднее. И только.

Это не вероятность того, что опорное значение истинно, и не вероятность того, что ваш результат был случайностью. Оба прочтения распространены и оба неверны: расчёт начинается с допущения, что опорное значение истинно, а потому никогда не скажет, насколько вероятным было само это допущение.

Почему мой результат стал значимым, когда я собрал больше данных?

Потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велико различие. Стандартная ошибка убывает как корень из числа наблюдений, поэтому то же самое различие даёт большую статистику всякий раз, когда выборка растёт.

Различие в четверть стандартного отклонения даёт 0,4495 при десяти наблюдениях, 0,0576 при шестидесяти, 0,0141 при ста и 0,0005 при двухстах. Само различие не изменилось ни разу. Поэтому его размер, посчитанный в стандартных отклонениях, стоит на этой странице рядом с ответом.

Наблюденияp-значениеЗначимо на уровне 5%
100.449524no
300.181415no
600.057602no
1000.014063yes
2000.000506yes
5000.000000yes
Может ли значимый результат всё равно быть неважным?

Да, и на больших выборках это происходит постоянно. Значимо означает, что различие трудно объяснить случайностью, а не что оно достаточно велико, чтобы действовать.

Лекарство, снижающее давление на сотую долю пункта, окажется значимым, если испытать его на достаточном числе людей, и бесполезным в любом случае. Сначала читайте размер различия, и только потом p-значение.

Какой уровень значимости выбрать?

5% — общепринятая условность в большинстве областей, но это условность, а не закон, и выбирать её надо до того, как вы увидели данные, а не после.

Понижайте его, когда ложная тревога дорога, — например, в решении, которое трудно отменить. Повышайте, когда хуже пропустить настоящий эффект, — например, в дешёвом отсеве, который позже перепроверят.

Что меняет односторонний критерий?

Он кладёт весь допуск на одну сторону, поэтому для объявления различия в названном вами направлении нужно меньше свидетельств, а в противоположном — вообще никаких.

Это работает, только если вы называете направление до того, как посмотрели. Решение проверять лишь «больше» потому, что среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие, и он удваивает ту частоту ложных тревог, на которую вы рассчитываете.