Deux fois plus de données ne rendent pas les estimations deux fois plus précises
Pour beaucoup de moyennes, réduire l'erreur aléatoire de moitié demande environ quatre fois plus d'observations. La précision offre des rendements en racine carrée.
L'erreur type diminue avec la racine carrée de la taille de l'échantillon, c'est pourquoi les petits échantillons flottent et les estimations très précises coûtent cher rapidement.
Par l'équipe de rédaction de Math Says Yes
Examiné par des humains selon nos normes en matière de sources et de corrections.
Supposer que la précision s'améliore de façon linéaire avec la taille de l'échantillon, de sorte que deux fois plus de données devraient signifier deux fois moins d'erreur.
Ce que mesure l'erreur type
L' est le flottement typique d'une estimation à travers des échantillons répétés. Si tu échantillonnais à plusieurs reprises la même et calculais la à chaque fois, ces moyennes d' ne seraient pas identiques. Elles formeraient leur propre autour de la vraie moyenne. L'erreur type décrit la dispersion de cette distribution, elle t'indique donc combien de bruit d'échantillonnage aléatoire subsiste dans l'estimation.
Ce que montrent les chiffres
10
100 lectures
7.1
200 lectures
5
400 lectures
Avec 100 lectures, le flottement typique est de ±10 points ; 200 le réduisent à environ ±7, et 400 atteignent ±5.
Le piège de la racine carrée
Passer de 100 à 400 observations réduit l'erreur de moitié environ ; passer de 400 à 1 600 la réduit à nouveau de moitié. L' diminue comme un divisé par la racine carrée de n. C'est une bonne nouvelle, car davantage de données sont utiles. C'est aussi une leçon d'humilité, car l'amélioration ralentit : le même gain de précision coûte plus cher à chaque fois.
Pourquoi l'intuition échoue
La plupart des quantités du quotidien semblent linéaires : deux fois plus d'argent achète deux fois plus d'articles, deux fois plus de distance prend deux fois plus de temps, et deux fois plus de travailleurs peuvent parfois faire deux fois plus de travail. La précision de l'échantillonnage est différente, car les erreurs aléatoires s'annulent dans les deux sens. Davantage d'observations ajoutent des informations, mais elles ajoutent aussi de nouvelles variations aléatoires. Le processus de moyennage l'emporte progressivement, et la règle de la racine carrée est le rythme auquel il s'établit.
Comment l'utiliser
Quand quelqu'un demande une estimation beaucoup plus précise, traduis cette demande en . Moitié moins d'erreur aléatoire signifie généralement quatre fois l' ; un dixième de l'erreur signifie environ cent fois l'échantillon. Cela ne veut pas dire que plus de données ne servent à rien. Cela signifie que la précision a un prix, et qu'une bonne conception d'étude doit déterminer si ce prix vaut la peine d'être payé pour la décision à prendre.
Exemple concret
Avec 100 observations, tu divises la dispersion brute par 10, la racine carrée de 100. C'est toute la méthode : si l' des mesures individuelles est fixe, l' d'une est cet écart-type divisé par la racine carrée de la taille de l'. Avec 400 observations, le diviseur est 20, donc l'erreur type est réduite de moitié. Doubler de 100 à 200 change seulement le diviseur de 10 à environ 14,1, ce qui est un gain utile mais pas un gain de précision multiplié par deux.
Quand cela s'applique
La règle de la racine carrée décrit le bruit d'échantillonnage aléatoire sous des hypothèses telles que des observations indépendantes et une stable. Cela ne signifie pas qu'un jeu de données plus grand est automatiquement meilleur. Si les nouvelles données proviennent d'une mauvaise population, répètent la même erreur de mesure ou sont sélectionnées de manière ée, l' peut paraître plus petite alors que l'estimation reste erronée.
Les erreurs les plus fréquentes
Doubler le budget d'une enquête, doubler les enregistrements ou doubler le temps d'expérience donne l'impression que cela devrait réduire l'incertitude de moitié. L' aléatoire ne fonctionne pas ainsi, et la précision ne s'échelle pas comme l'effort. La relation de la racine carrée signifie que la précision s'améliore, mais les gains faciles arrivent tôt.
Note sur la source
Altman et Bland expliquent la différence entre l' et l', y compris pourquoi l'erreur type mesure la précision d'une estimation plutôt que la variabilité entre individus. Cette distinction est à la base de la leçon principale de la page : l'augmentation de la taille de l' améliore la précision grâce à la d'échantillonnage, mais l'amélioration suit une courbe de racine carrée.
FAQ
Pourquoi l'erreur type diminue-t-elle avec la racine carrée de la taille de l'échantillon ?
Des erreurs aléatoires indépendantes s'annulent partiellement lorsqu'elles sont moyennées. Les mathématiques de la variance font que la dispersion de la moyenne de l'échantillon diminue avec la racine carrée de n, et non directement avec n.
Plus de données résout-il toujours l'incertitude ?
Des données plus représentatives réduisent l'erreur d'échantillonnage aléatoire, mais elles ne corrigent pas le biais, la mauvaise mesure, la non-réponse, le facteur de confusion ou un échantillon qui rate la population qui t'intéresse.
Vérification rapide
Si tu veux réduire de moitié l’écart-type d’une moyenne, de combien de données supplémentaires as-tu besoin à peu près ?