Calculateur de test d'hypothèse avec z et t
Vos données
Choisissez le sens avant de regarder les données, pas après. Décider de ne tester que vers le haut parce que la moyenne mesurée s'est trouvée plus élevée est la plus vieille façon qui soit de transformer un pile ou face en découverte.
Résultats
À quelle fréquence un écart au moins aussi grand surviendrait par le seul hasard, si la vraie moyenne valait exactement la valeur à laquelle vous comparez
—
| La statistique de test | — |
| Sur quelle loi on la lit | — |
| Degrés de liberté | — |
| La valeur que la statistique doit dépasser | — |
| La taille de l'écart, comptée en écarts types | — |
| Ce que l'autre loi aurait répondu | — |
| Plage avec laquelle la vraie moyenne est compatible | — |
Le même écart, mesuré sur plus de monde
| Observations | La statistique de test | À quelle fréquence le seul hasard le ferait | Verdict |
|---|
Rien de l'écart ne change au fil de ce tableau. La moyenne, la valeur de comparaison et l'écart type restent exactement où vous les avez mis, et seul le nombre d'observations augmente. Pourtant le verdict bascule en cours de route, parce que le test mesure la qualité de votre mesure, pas la taille de la chose. C'est pourquoi la taille de l'écart figure dans le tableau ci-dessus, à côté de la réponse.
L'autre ligne qui mérite lecture est celle qui compare les deux lois. Quand l'écart type a été estimé sur l'échantillon plutôt que connu d'avance, la loi de Student est l'honnête, et elle est plus exigeante que la normale précisément parce qu'elle doit tenir compte du fait que l'écart type est lui-même une estimation. Sur de petits échantillons l'écart suffit à renverser le verdict, et il ne se referme que lentement : même avec cent observations, les deux divergent encore à la troisième décimale.
Une chose que ce nombre n'est pas, quoi qu'on en dise souvent : ce n'est pas la probabilité que la valeur comparée soit la vraie. Il se calcule en supposant cette valeur vraie et en demandant à quel point vos données seraient surprenantes. Retourner cela exige quelque chose que les données seules ne fournissent pas : la plausibilité de la valeur avant toute mesure.
Dois-je utiliser le test z ou le test t ?
Utilisez le test t chaque fois que l'écart type vient de l'échantillon même que vous testez, ce qui est presque toujours le cas. N'utilisez z que lorsque l'écart type est réellement connu d'avance pour la population entière, à partir d'un long historique de la même mesure et non de ces observations.
Cela compte surtout sur les petits échantillons. Avec la même statistique de 2,10 et un test bilatéral, la loi de Student donne 0,1037 sur cinq observations quand la normale donne 0,0357 : l'une y voit un résultat à 5%, l'autre non. Les deux s'accordent à partir d'une vingtaine d'observations, et même à cent elles diffèrent encore à la troisième décimale.
| Observations | p par la loi de Student | p par la loi normale |
|---|---|---|
| 5 | 0.1037 | 0.0357 |
| 8 | 0.0739 | 0.0357 |
| 10 | 0.0651 | 0.0357 |
| 15 | 0.0543 | 0.0357 |
| 20 | 0.0493 | 0.0357 |
| 30 | 0.0445 | 0.0357 |
Que veut dire au juste la valeur p ?
C'est à quelle fréquence un écart au moins aussi grand que le vôtre apparaîtrait par le seul hasard, dans un monde où la valeur de référence est la vraie moyenne. Rien de plus.
Ce n'est pas la probabilité que la valeur de référence soit vraie, ni la probabilité que votre résultat soit un coup de chance. Ces deux lectures sont courantes et toutes deux fausses, car le calcul commence en supposant la valeur de référence vraie : il ne peut donc jamais dire quelle était la probabilité de cette supposition.
Pourquoi mon résultat est-il devenu significatif quand j'ai collecté plus de données ?
Parce que le test mesure la qualité de votre mesure, pas la taille de l'écart. L'erreur type diminue comme la racine carrée du nombre d'observations, si bien que le même écart produit une statistique plus grande chaque fois que l'échantillon grandit.
Un écart d'un quart d'écart type donne 0,4495 sur dix observations, 0,0576 sur soixante, 0,0141 sur cent et 0,0005 sur deux cents. L'écart n'a pas changé une seule fois. C'est pourquoi sa taille, comptée en écarts types, figure à côté de la réponse sur cette page.
| Observations | valeur p | Significatif à 5% |
|---|---|---|
| 10 | 0.449524 | no |
| 30 | 0.181415 | no |
| 60 | 0.057602 | no |
| 100 | 0.014063 | yes |
| 200 | 0.000506 | yes |
| 500 | 0.000000 | yes |
Un résultat significatif peut-il rester sans importance ?
Oui, et cela arrive constamment sur les grands échantillons. Significatif veut dire que l'écart s'explique mal par le hasard, pas qu'il est assez grand pour agir.
Un médicament qui abaisse la tension d'un centième de point sera significatif si vous le testez sur assez de monde, et inutile de toute façon. Lisez d'abord la taille de l'écart, la valeur p ensuite.
Quel seuil de signification choisir ?
5% est la convention dans la plupart des domaines, mais c'est une convention et non une loi, et il doit être choisi avant de voir les données, pas après.
Abaissez-le quand une fausse alerte coûte cher, comme dans une décision difficile à défaire. Relevez-le quand rater un effet réel est la pire erreur, comme dans un dépistage bon marché qui sera revérifié ensuite.
Qu'est-ce que change un test unilatéral ?
Il met toute la tolérance d'un seul côté : il faut donc moins de preuves pour déclarer un écart dans le sens que vous avez nommé, et aucune dans l'autre sens.
Cela ne vaut que si vous nommez le sens avant de regarder. Décider de ne tester que vers le haut parce que la moyenne s'est trouvée plus élevée est la plus vieille façon qui soit de transformer un pile ou face en découverte, et cela double le taux de fausses alertes que vous croyez courir.
Réactions
0
0 commentaires
Soyez le premier à commenter