Qué prueba estadística debo usar
Responde las preguntas
¿Qué quieres averiguar?
¿Qué estás midiendo en cada grupo?
¿Cuántos grupos estás comparando?
¿Las dos medidas son de los mismos sujetos?
¿Se mide a los mismos sujetos en todas las condiciones?
¿Cómo están organizadas las categorías?
¿Alguna celda de la tabla espera menos de cinco casos?
¿De qué tipo son las dos variables?
¿La nube de puntos parece una recta, sin valores atípicos extremos?
¿De qué tipo es la variable que quieres predecir?
¿A partir de cuántas variables estás prediciendo?
Prueba t para una muestra
Pregunta si la media de tu grupo difiere de un valor que ya conocías.
Comprueba que los datos sean más o menos simétricos. Si no lo son, usa la prueba de Wilcoxon de rangos con signo.
Prueba t para muestras independientes
Pregunta si dos grupos separados tienen medias distintas.
Comprueba que cada grupo sea más o menos simétrico. Si no lo son, usa la prueba U de Mann-Whitney.
Prueba t pareada
Pregunta si los mismos sujetos cambiaron entre las dos medidas.
Comprueba que las diferencias sean más o menos simétricas. Si no lo son, usa la prueba de Wilcoxon de rangos con signo.
ANOVA de un factor
Pregunta si al menos uno de tres o más grupos difiere de los demás.
Te dice que algún grupo difiere, no cuál, así que después viene una comparación post hoc. Si los datos no son simétricos, usa la prueba de Kruskal-Wallis.
ANOVA de medidas repetidas
Pregunta si los mismos sujetos cambiaron a lo largo de tres o más condiciones.
Comprueba la esfericidad y corrígela si falla. La alternativa por rangos es la prueba de Friedman.
Chi cuadrado de bondad de ajuste
Pregunta si los recuentos que observaste coinciden con las proporciones que esperabas.
Con solo dos categorías y pocos casos, la prueba binomial exacta es la opción más segura.
Chi cuadrado de independencia
Pregunta si dos variables categóricas están asociadas.
Dice que hay asociación, no cuán fuerte. Informa junto a él un tamaño del efecto, como la V de Cramér.
Prueba exacta de Fisher
Responde a la misma pregunta que el chi cuadrado, pero sigue siendo válido con recuentos pequeños.
Úsala siempre que una frecuencia esperada baje de cinco, que es justo donde el chi cuadrado deja de ser fiable.
Prueba de McNemar
Pregunta si los mismos sujetos cambiaron de categoría entre dos momentos.
Solo los sujetos que cambiaron aportan información; los que se quedaron igual no entran en la prueba.
Correlación de Pearson
Mide cuánto se acercan dos variables numéricas a una relación de línea recta.
Correlación no es causalidad, y un solo valor atípico puede crearla o destruirla. Dibuja los puntos antes de fiarte del número.
Correlación de Spearman
Mide si una variable sube cuando la otra sube, sin exigir una línea recta.
Trabaja con rangos, así que resiste los valores atípicos y también sirve para escalas ordenadas.
Regresión lineal simple
Traza la recta que mejor predice un número a partir de otro número.
Mira los residuos: no deben tener ningún patrón. Una curva en ellos significa que la recta es la forma equivocada.
Regresión lineal múltiple
Predice un número a partir de varias otras variables a la vez.
Comprueba que las variables predictoras no estén diciendo lo mismo entre sí, lo que infla los coeficientes y los vuelve inestables.
Regresión logística
Predice la probabilidad de un resultado sí o no.
Sus coeficientes son razones de momios, no diferencias de probabilidad, y leer uno como el otro es el error habitual.
Regresión logística multinomial
Predice en cuál de varias categorías sin orden cae una observación.
Todo resultado se lee contra una categoría de referencia, así que di cuál elegiste.
Regresión logística ordinal
Predice una posición en una escala ordenada, manteniendo el orden dentro del modelo.
Supone que el efecto es el mismo en cada corte de la escala. Pon a prueba ese supuesto antes de informar.
Regresión de Poisson
Predice cuántas veces ocurre algo en un periodo o en un lugar.
Supone que la varianza es igual a la media. Cuando la varianza es mucho mayor, usa la regresión binomial negativa.
¿Cómo sé si mis datos son lo bastante normales para una prueba t?
Dibújalos primero. Un histograma o un diagrama de caja responde más rápido que cualquier prueba, y lo que importa no es la normalidad perfecta, sino si la forma es más o menos simétrica y sin valores atípicos extremos.
La prueba t también se vuelve más tolerante al crecer la muestra, así que una asimetría leve con cien casos rara vez es un problema, mientras que la misma con ocho casos sí lo es. En la duda, corre también la alternativa por rangos: si ambas coinciden, la elección no importó.
¿Cuál es la diferencia entre una prueba paramétrica y una basada en rangos?
Una prueba paramétrica trabaja con los valores mismos y supone una forma para ellos, normalmente algo cercano a la curva normal. Una prueba basada en rangos descarta los valores y conserva solo su orden, y por eso los valores atípicos dejan de importar.
El precio es que la prueba basada en rangos responde a una pregunta algo distinta y tiene menos potencia cuando el supuesto de la paramétrica sí se cumple. Ninguna es un valor por defecto más seguro; son respuestas a situaciones distintas.
La prueba salió significativa. ¿Eso significa que el efecto es grande?
No. Un valor p responde si el resultado es difícil de explicar por azar, y con una muestra lo bastante grande hasta una diferencia mínima se vuelve difícil de explicar por azar.
Informa junto a él un tamaño del efecto, y un intervalo de confianza si puedes. El tamaño le dice al lector si la diferencia importa; el valor p solo dice que probablemente no es ruido.
¿Esto sustituye a preguntarle a alguien que sabe estadística?
No, y no lo pretende. Señala la opción que encaja con la forma de tu pregunta y te dice qué supuesto comprobar antes de usarla.
Los datos reales traen cosas que un diagrama de flujo no ve: valores faltantes, sujetos medidos más de una vez, grupos de tamaños muy distintos, variables elegidas después de mirar los resultados. Cualquiera de ellas puede cambiar la respuesta.
Reacciones
0
0 Comentarios
Se el primero en comentar