Plus de données aident, mais l'erreur aléatoire diminue lentement : pour diviser par deux le bruit dans une moyenne, il faut généralement quatre fois plus d'observations.
Par l'équipe de rédaction de Math Says Yes
Examiné par des humains selon nos normes en matière de sources et de corrections.
Lorsque l'on fait la d'observations indépendantes, les erreurs aléatoires s'annulent en partie. Cette annulation est réelle, mais elle suit un modèle de racine carrée. Si tu multiplies l' par 4, l' est réduit de moitié environ. Si tu le multiplies par 100, l'écart-type est réduit d'environ 10. C'est pourquoi les premières observations supplémentaires aident beaucoup, tandis que les améliorations ultérieures deviennent de plus en plus coûteuses.
Pourquoi les petits échantillons induisent en erreur
Un tout petit présente un vaste nuage d'estimations possibles. Il peut tomber près de la vérité, mais il peut aussi tomber extrêmement haut ou extrêmement bas par simple hasard. Comme l'erreur est grande, les petits échantillons dominent les listes d'extrêmes : meilleures villes, pires hôpitaux, fonds les plus performants ou routes les plus dangereuses. Certaines entrées sont réellement inhabituelles, mais beaucoup ne sont que des estimations bruitées qui n'ont pas eu assez d'observations pour se stabiliser.
La puissance est une précision qui a un rôle
La puissance statistique cherche à savoir si une étude est suffisamment précise pour détecter un effet d'une taille donnée. Si le vrai effet est petit et que l' est bruité, l'étude peut passer à côté. Cela ne prouve pas que l'effet est absent ; cela prouve peut-être seulement que l'étude était trop imprécise pour le voir. La puissance transforme la règle de la racine carrée en question de conception : combien de données faut-il pour que le signal ait une équitable de s'élever au-dessus du bruit ?
Comment l'utiliser
Avant de faire confiance à une estimation, demande-toi si l' est assez grand pour la décision à prendre. Pour une orientation approximative, un échantillon modeste peut suffire. Pour de petites différences, la sécurité médicale ou un classement à fort enjeu, l'échantillon doit peut-être être beaucoup plus grand que l'intuition ne le suggère. Rappelle-toi la courbe des coûts : deux fois plus de précision ne demande pas deux fois plus de données. Il en faut généralement environ quatre fois plus.
FAQ
Pourquoi faut-il quatre fois plus de données pour diviser l'erreur par deux ?
Pour de nombreuses moyennes indépendantes, l'écart-type est proportionnel à 1 divisé par la racine carrée de la taille de l'échantillon. Pour que cette erreur soit deux fois plus petite, la taille de l'échantillon doit être quatre fois plus grande.
Un résultat non significatif prouve-t-il qu'il n'y a aucun effet ?
Pas nécessairement. Une étude à faible puissance peut passer à côté d'un effet réel parce que l'échantillon est trop petit ou bruité. Il faut l'intervalle, la taille de l'effet et la puissance de l'étude pour juger de la signification d'un résultat nul.