Калькулятор проверки гипотез по z и t

Ваши данные

Выберите направление до того, как посмотрите на данные, а не после. Решение проверять только «больше» потому, что измеренное среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие.

Результаты

Как часто различие не меньше этого возникало бы по одной лишь случайности, если бы истинное среднее равнялось именно опорному значению

—

Статистика критерия—
По какому распределению это читается—
Число степеней свободы—
Значение, которое статистика должна превзойти—
Насколько велико различие, в стандартных отклонениях—
Что ответило бы другое распределение—
Диапазон, с которым совместимо истинное среднее—

То же различие, измеренное на большем числе людей

НаблюденияСтатистика критерияКак часто это сделала бы одна случайностьВывод

В этой таблице в самом различии не меняется ничего. Среднее, опорное значение и отклонение остаются ровно там, куда вы их поставили, растёт только число наблюдений. И всё же вывод переворачивается на полпути, потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велика сама вещь. Поэтому размер различия стоит в таблице выше, рядом с ответом.

Другая строка, которую стоит прочесть, — сравнение двух распределений. Когда отклонение оценено по выборке, а не известно заранее, честным оказывается распределение Стьюдента, и оно строже нормального именно потому, что должно учесть: само отклонение — догадка. На малых выборках разрыв достаточен, чтобы перевернуть вывод, и закрывается он медленно: даже при ста наблюдениях они расходятся в третьем знаке после запятой.

Одного это число не означает, как бы часто его так ни описывали: это не вероятность того, что опорное значение истинно. Оно вычисляется в предположении, что значение истинно, и отвечает на вопрос, насколько удивительными были бы ваши данные. Чтобы перевернуть это, нужно то, чего одни данные дать не могут, — насколько правдоподобным значение было до всяких измерений.

Реакции

0

0 Комментарии

User profile image

Прокомментируйте первым

Что использовать: z-критерий или t-критерий?

Используйте t-критерий всякий раз, когда стандартное отклонение получено из той же выборки, которую вы проверяете, — а это почти всегда. Берите z только тогда, когда отклонение действительно известно заранее для всей совокупности, из долгой истории того же измерения, а не из этих наблюдений.

Больше всего это важно на малых выборках. При одной и той же статистике 2,10 и двустороннем критерии распределение Стьюдента при пяти наблюдениях даёт 0,1037, а нормальное — 0,0357: одно называет это находкой на уровне 5%, другое нет. Согласие наступает примерно с двадцати наблюдений, и даже при ста они всё ещё расходятся в третьем знаке.

Наблюденияp по Стьюдентуp по нормальному
50.10370.0357
80.07390.0357
100.06510.0357
150.05430.0357
200.04930.0357
300.04450.0357
Что на самом деле означает p-значение?

Это то, как часто различие не меньше вашего возникало бы по одной лишь случайности в мире, где опорное значение и есть истинное среднее. И только.

Это не вероятность того, что опорное значение истинно, и не вероятность того, что ваш результат был случайностью. Оба прочтения распространены и оба неверны: расчёт начинается с допущения, что опорное значение истинно, а потому никогда не скажет, насколько вероятным было само это допущение.

Почему мой результат стал значимым, когда я собрал больше данных?

Потому что критерий измеряет, насколько хорошо вы измерили, а не насколько велико различие. Стандартная ошибка убывает как корень из числа наблюдений, поэтому то же самое различие даёт большую статистику всякий раз, когда выборка растёт.

Различие в четверть стандартного отклонения даёт 0,4495 при десяти наблюдениях, 0,0576 при шестидесяти, 0,0141 при ста и 0,0005 при двухстах. Само различие не изменилось ни разу. Поэтому его размер, посчитанный в стандартных отклонениях, стоит на этой странице рядом с ответом.

Наблюденияp-значениеЗначимо на уровне 5%
100.449524no
300.181415no
600.057602no
1000.014063yes
2000.000506yes
5000.000000yes
Может ли значимый результат всё равно быть неважным?

Да, и на больших выборках это происходит постоянно. Значимо означает, что различие трудно объяснить случайностью, а не что оно достаточно велико, чтобы действовать.

Лекарство, снижающее давление на сотую долю пункта, окажется значимым, если испытать его на достаточном числе людей, и бесполезным в любом случае. Сначала читайте размер различия, и только потом p-значение.

Какой уровень значимости выбрать?

5% — общепринятая условность в большинстве областей, но это условность, а не закон, и выбирать её надо до того, как вы увидели данные, а не после.

Понижайте его, когда ложная тревога дорога, — например, в решении, которое трудно отменить. Повышайте, когда хуже пропустить настоящий эффект, — например, в дешёвом отсеве, который позже перепроверят.

Что меняет односторонний критерий?

Он кладёт весь допуск на одну сторону, поэтому для объявления различия в названном вами направлении нужно меньше свидетельств, а в противоположном — вообще никаких.

Это работает, только если вы называете направление до того, как посмотрели. Решение проверять лишь «больше» потому, что среднее вышло выше, — самый старый способ превратить подбрасывание монеты в открытие, и он удваивает ту частоту ложных тревог, на которую вы рассчитываете.