Calculadora de prueba de hipótesis con z y t
Tus datos
Elige la dirección antes de mirar los datos, no después. Decidir contrastar solo hacia arriba porque la media que mediste salió más alta es la forma más antigua que existe de convertir un cara o cruz en un hallazgo.
Resultados
Con qué frecuencia aparecería por puro azar una diferencia al menos así de grande, si la media verdadera fuera exactamente el valor con el que comparas
—
| El estadístico de contraste | — |
| Contra qué distribución se lee | — |
| Grados de libertad | — |
| El valor que el estadístico tiene que superar | — |
| Cuán grande es la diferencia, contada en desviaciones estándar | — |
| Qué habría respondido la otra distribución | — |
| Rango con el que la media verdadera es compatible | — |
La misma diferencia, medida en más gente
| Observaciones | El estadístico de contraste | Con qué frecuencia lo haría el puro azar | Veredicto |
|---|
Nada de la diferencia cambia a lo largo de esa tabla. La media, el valor de comparación y la desviación se quedan exactamente donde los pusiste, y solo crece el número de observaciones. Aun así el veredicto se da la vuelta a mitad de camino, porque el contraste mide lo bien que mediste, no lo grande que es la cosa. Por eso el tamaño de la diferencia está en la tabla de arriba, junto a la respuesta.
La otra fila que vale la pena leer es la que compara las dos distribuciones. Cuando la desviación se estimó de la muestra en vez de conocerse de antemano, la t de Student es la honesta, y es más exigente que la normal justamente porque tiene que contar con que la propia desviación es una conjetura. En muestras pequeñas la diferencia basta para dar la vuelta al veredicto, y solo se cierra despacio: incluso con cien observaciones las dos siguen separándose en el tercer decimal.
Una cosa que esta cifra no es, por mucho que se la describa así: no es la probabilidad de que el valor con el que comparaste sea el verdadero. Se calcula suponiendo que ese valor es verdadero y preguntando cuán sorprendentes serían tus datos. Darle la vuelta exige algo que los datos por sí solos no aportan: cuán plausible era el valor antes de que midieras nada.
¿Debo usar la prueba z o la prueba t?
Usa la prueba t siempre que la desviación estándar venga de la misma muestra que estás contrastando, que es casi siempre. Usa z solo cuando la desviación se conoce de verdad de antemano para toda la población, a partir de un largo historial de la misma medición y no de estas observaciones.
Esto pesa más en muestras pequeñas. Con el mismo estadístico de 2,10 y contraste bilateral, la t da 0,1037 con cinco observaciones mientras que la normal da 0,0357: una lo llama hallazgo al 5% y la otra no. Las dos concuerdan a partir de unas veinte observaciones, y aun con cien siguen difiriendo en el tercer decimal.
| Observaciones | p por la t | p por la normal |
|---|---|---|
| 5 | 0.1037 | 0.0357 |
| 8 | 0.0739 | 0.0357 |
| 10 | 0.0651 | 0.0357 |
| 15 | 0.0543 | 0.0357 |
| 20 | 0.0493 | 0.0357 |
| 30 | 0.0445 | 0.0357 |
¿Qué significa realmente el valor p?
Es con qué frecuencia aparecería por puro azar una diferencia al menos tan grande como la tuya, en un mundo donde el valor de referencia es la media verdadera. Nada más.
No es la probabilidad de que el valor de referencia sea verdadero, ni la probabilidad de que tu resultado fuera casualidad. Ambas lecturas son comunes y ambas son falsas, porque el cálculo empieza suponiendo que el valor de referencia es verdadero, así que nunca puede decirte cuán probable era esa suposición.
¿Por qué mi resultado se volvió significativo al recoger más datos?
Porque el contraste mide lo bien que mediste, no lo grande que es la diferencia. El error estándar se encoge con la raíz cuadrada del número de observaciones, así que la misma diferencia produce un estadístico mayor cada vez que la muestra crece.
Una diferencia de un cuarto de desviación estándar da 0,4495 con diez observaciones, 0,0576 con sesenta, 0,0141 con cien y 0,0005 con doscientas. La diferencia no cambió ni una vez. Por eso su tamaño, contado en desviaciones estándar, está junto a la respuesta en esta página.
| Observaciones | valor p | Significativo al 5% |
|---|---|---|
| 10 | 0.449524 | no |
| 30 | 0.181415 | no |
| 60 | 0.057602 | no |
| 100 | 0.014063 | yes |
| 200 | 0.000506 | yes |
| 500 | 0.000000 | yes |
¿Puede un resultado significativo ser aun así poco importante?
Sí, y pasa constantemente en muestras grandes. Significativo quiere decir que la diferencia cuesta de explicar por azar, no que sea lo bastante grande como para actuar.
Un fármaco que baja la tensión una centésima de punto será significativo si lo pruebas en suficiente gente, e inútil de todos modos. Lee primero el tamaño de la diferencia y después el valor p.
¿Qué nivel de significancia debo elegir?
El 5% es la convención en casi todos los campos, pero es una convención y no una ley, y debe elegirse antes de ver los datos, no después.
Bájalo cuando una falsa alarma sale cara, como en una decisión difícil de deshacer. Súbelo cuando dejar pasar un efecto real es el peor error, como en un cribado barato que se comprobará otra vez más adelante.
¿Qué cambia un contraste unilateral?
Pone toda la tolerancia de un solo lado, así que necesita menos evidencia para declarar diferencia en la dirección que nombraste, y ninguna en la contraria.
Eso solo vale si nombras la dirección antes de mirar. Decidir contrastar solo hacia arriba porque la media salió más alta es la forma más antigua que existe de convertir un cara o cruz en un hallazgo, y duplica la tasa de falsas alarmas que crees estar corriendo.
Reacciones
0
0 Comentarios
Se el primero en comentar