Un petit échantillon peut s'éloigner de la vérité par simple chance, tandis qu'un échantillon plus grand élimine cette chance par la moyenne. Cette leçon montre comment la dispersion diminue avec la racine carrée de la taille de l'échantillon et pourquoi les plus petits groupes dominent les extrêmes de tout classement.
Par l'équipe de rédaction de Math Says Yes
Examiné par des humains selon nos normes en matière de sources et de corrections.
Tout taux mesuré est un mélange de la vraie valeur sous-jacente et de bruit aléatoire. Avec seulement quelques observations, le bruit a une voix forte : un seul cas inhabituel peut faire basculer le résultat loin de la vérité. Au fur et à mesure que tu ajoutes des observations, les hauts chanceux et les bas malchanceux commencent à s'annuler, et la se rapproche de la valeur réelle. C'est la sous une forme quotidienne. Un plus grand n'est pas seulement un peu plus fiable ; il élimine activement par la moyenne la qui domine un petit échantillon, c'est pourquoi tu dois faire bien plus confiance à un taux basé sur des milliers de cas qu'au même taux basé sur une douzaine.
La règle de la racine carrée
L'oscillation d'un ne diminue pas au même rythme que la taille de l'échantillon ; elle diminue avec sa racine carrée. En gros, la distance typique par rapport à la vérité évolue comme un sur la racine carrée de n. Cela a une signification pratique directe : pour réduire l'oscillation de moitié, tu n'as pas besoin de deux fois plus de données, mais de quatre fois plus. Pour la réduire à un tiers, tu as besoin de neuf fois plus. C'est pourquoi les premières données sont si instables et pourquoi les cent premières réponses à un sondage oscillent beaucoup plus que les mille suivantes. Chaque nouvelle observation aide, mais avec des rendements décroissants, de sorte que la précision coûte cher et que les petits échantillons restent obstinément bruyants.
Classement des petites unités
Chaque fois que tu classes des lieux, des écoles, des hôpitaux ou des équipes par un taux, les extrêmes de la liste ont tendance à être les plus petites unités, et non les plus spéciales. Un village de deux cents personnes peut afficher le taux de maladie le plus élevé ou le plus bas d'un pays la même année, simplement parce qu'un ou deux cas modifient énormément son taux. Une grande ville ne peut jamais osciller autant, car son énorme dénominateur l'ancre près de la . Ainsi, un classement des taux du plus haut au plus bas devient souvent un classement de qui est le plus petit, habillé en classement de qui est le meilleur ou le pire. Le motif est si fiable que voir de minuscules unités aux deux extrémités est un indice que les différences sont principalement du bruit.
L'habitude
La solution est une petite habitude : lis le dénominateur avant de réagir au taux. Chaque fois qu'un pourcentage, un chiffre par habitant ou un classement se présente devant toi, demande sur combien de cas et de personnes il est basé. Un taux surprenant basé sur cinq cas mérite un haussement d'épaules, pas un titre de journal. Lorsque tu compares des unités de tailles très différentes, il est utile de réduire les taux de petits échantillons les plus bruyants vers la globale avant de les classer, ce qui évite que de minuscules groupes ne détournent les deux extrémités de la liste. Le nombre du dessus est le taux, mais le nombre du dessous est celui qui te dit s'il faut y croire.
FAQ
Comment la taille de l'échantillon affecte-t-elle la dispersion d'un taux ?
Avec peu d'observations, un seul cas inhabituel déplace beaucoup le taux, de sorte qu'un petit échantillon peut atterrir bien au-dessus ou bien en dessous de la vraie valeur par le seul effet du hasard. De grands échantillons absorbent ces cas individuels, de sorte que leurs taux restent proches de la vérité et atteignent rarement les extrêmes.
Pourquoi le fait de collecter plus de données rend-il un taux plus digne de confiance ?
Cela signifie qu'au fur et à mesure que tu collectes plus d'observations, la moyenne de ton échantillon se rapproche régulièrement de la vraie moyenne et les oscillations aléatoires diminuent. Plus l'échantillon est grand, plus la chance s'annule, c'est pourquoi un taux provenant de milliers de cas est bien plus digne de confiance que le même taux provenant d'une poignée.
Tire plusieurs échantillons de lancers de pièces équilibrées et observe la dispersion.
40 pts
dispersion du taux de piles
lancers par échantillon: 10
Avec 10 lancers par échantillon, les douze tirages se répartissent sur 40 points de pourcentage. Les petits échantillons s'éloignent beaucoup de 50 % par simple chance ; ajoute et cet écart tend vers zéro.
Vérification rapide
Pourquoi les plus petites villes apparaissent-elles souvent à la FOIS en haut et en bas d’un classement par « taux pour 100 000 » ?
A
Les populations minuscules s’écartent fortement du vrai taux par pur hasard.
B
Les petites villes sont véritablement plus saines et plus malades que les grandes villes.
C
Les taux pour 100 000 ne fonctionnent que pour les grandes villes.