Math Says Yes
Collection

Échantillonnage et moyennes

Ce que les moyennes peuvent et ne peuvent pas te dire, et pourquoi la taille de l'échantillon change tout.
Un seul avis sur un produit peut dire n'importe quoi. Une centaine d'avis commencent à signifier quelque chose. Ce passage d'un chiffre bruyant à une moyenne stable est le cœur de la plupart des statistiques pratiques, et chaque page de cette collection en traite une partie.
La mécanique vient d'abord. Les visiteurs de la foire de Galton ont deviné le poids d'un bœuf mieux ensemble que n'importe quel expert seul, et les moyennes de données presque désordonnées se stabilisent dans la même forme de cloche à mesure que les échantillons grandissent. La précision obéit cependant à une règle têtue de racine carrée : pour diviser l'erreur par deux, il faut quatre fois plus de données.
Viennent ensuite les pièges. Les petits échantillons fluctuent assez fortement pour couronner de faux gagnants. Les résultats extrêmes reviennent vers la normale lors de la mesure suivante, ce qui explique comment les entraîneurs et les radars récoltent des lauriers qu'ils n'ont pas mérités. Et lorsque les données sont asymétriques, la moyenne arithmétique et la médiane cessent de s'accorder, de sorte que la première question à se poser concernant toute moyenne est celle qu'on t'a donnée.
Si tu prends des décisions à partir de tableaux de bord ou d'avis, ces pages t'indiquent le niveau de bruit à attendre pour une taille d'échantillon donnée. C'est généralement suffisant pour éviter une mauvaise décision.

Le bruit diminue lentement

Doubler tes données ne divise pas ton erreur par deux ; la quadrupler le fait. Cette arithmétique de la racine carrée explique pourquoi les sondages stagnent autour d'un millier de répondants et pourquoi la dernière décimale de précision est toujours la plus coûteuse. Prévois-le avant l'étude, pas après.

Les extrêmes reviennent en arrière

Choisis n'importe quoi parce qu'il était extrême, un trimestre record ou un taux d'erreur parmi les pires, et sa mesure suivante sera généralement plus proche de la moyenne sans aucune intervention. La régression vers la moyenne est l'explication à écarter avant d'attribuer le mérite à une correction, un entraîneur ou une politique.

Quelle moyenne t'a-t-on donnée ?

Une rue où neuf maisons se vendent autour de 250 000 et une autre 2 millions a une moyenne arithmétique supérieure à 400 000 qui ne correspond à aucune maison réelle. L'asymétrie éloigne la moyenne de la médiane, et la plupart des données financières sont asymétriques. Lorsqu'un rapport mentionne une "moyenne", découvrir de laquelle il s'agit représente la moitié de l'analyse.

Faits mis en avant

Psychologie des nombres
4 min · facile
De nombreuses bulles d'estimation de différentes tailles convergent vers la silhouette d'un bœuf.
La foule d'une foire a deviné le poids d'un bœuf avec une précision presque parfaite
Lors d'une foire agricole en 1906, la médiane de centaines d'estimations indépendantes du poids d'un bœuf s'est approchée à environ 1 % de la vérité, battant presque tous les estimateurs individuels.
Probabilité
4 min · moyen
Des points individuels désordonnés se fondant dans une courbe en cloche lisse de moyennes.
Le théorème limite central donne aux moyennes une allure normale
Les données individuelles peuvent être asymétriques ou désordonnées, tandis que les moyennes de nombreuses observations indépendantes forment souvent un motif net en forme de cloche.
Trucs de données
4 min · facile
Points regroupés en échantillons de 100 et 400 avec une bande d'erreur plus petite autour du plus grand échantillon.
Deux fois plus de données ne rendent pas les estimations deux fois plus précises
Pour beaucoup de moyennes, réduire l'erreur aléatoire de moitié demande environ quatre fois plus d'observations. La précision offre des rendements en racine carrée.
Paradoxes
4 min · moyen
Les meneurs reviennent vers le peloton tandis que les coureurs en retard rattrapent le milieu.
Les meilleurs s'essoufflent généralement la fois suivante
Les meilleurs marqueurs d'une équipe, les meilleurs élèves d'un test et les patients les plus malades d'une clinique ont tous tendance à revenir vers le milieu lors de la mesure suivante, sans aucune intervention, parce que le résultat extrême était en partie dû au talent et en partie à la chance, et que la chance se répète rarement.
Trucs de données
4 min · moyen
Quelques pièces dispersées largement d'un côté, de nombreuses pièces regroupées de manière serrée de l'autre.
Les plus petites villes dominent à la fois les classements des meilleurs et des pires
Classe des lieux selon n'importe quel taux (cancers, résultats aux examens, criminalité) et les extrêmes seront dominés par les plus petites localités, car de petits échantillons s'écartent fortement du vrai taux par le seul effet du hasard.
Trucs de données
5 min · facile
Des barres allant de courtes à hautes, un pointeur sur la barre du milieu et une ligne pointillée se trouvant bien au-dessus de la plupart d'entre elles.
Moyenne vs médiane : quelle moyenne dois-tu utiliser ?
La moyenne partage le total de manière égale. La médiane trouve le cas du milieu. Dans des données biaisées, celles-ci peuvent raconter des histoires très différentes.

Concepts

Loi des grands nombres
À mesure qu'un échantillon grandit, sa moyenne se rapproche de la moyenne réelle et les fluctuations aléatoires se réduisent, à peu près proportionnellement à 1 sur la racine carrée de la taille de l'échantillon. De petits échantillons peuvent s'éloigner de la vérité purement par chance, ce qui explique pourquoi une poignée d'observations est si facile à mal interpréter.
Théorème limite central
Le théorème limite central indique que les moyennes de nombreuses influences aléatoires indépendantes et de taille similaire ont tendance à former une distribution d'échantillonnage en forme de cloche, même lorsque les données d'origine ne le sont pas. Il explique pourquoi les moyennes sont souvent plus prévisibles que les observations individuelles.
Régression vers la moyenne
Une mesure extrême est généralement un mélange d’une partie stable et répétable et d’une partie chanceuse ponctuelle. Comme la partie chanceuse se produit rarement de la même manière deux fois, la mesure suivante de la même chose a tendance à se rapprocher de la moyenne. Ce n’est pas une force qui attire les choses vers le milieu. C’est simplement l’effet d’une sélection basée sur la chance lorsque tu mesures à nouveau.
Erreur type
L'erreur type est la fluctuation d'échantillonnage typique d'une estimation telle qu'une moyenne. Pour des observations indépendantes, l'erreur type d'une moyenne diminue avec la racine carrée de la taille de l'échantillon, de sorte que diviser l'erreur par deux nécessite généralement quatre fois plus de données.
Les moyennes trompent
La moyenne arithmétique additionne tout et divise, de sorte que quelques valeurs extrêmes peuvent l’éloigner fortement du cas typique. Dans des données asymétriques, la médiane — la valeur du milieu — représente mieux ce qui est normal. Renseigne-toi sur la forme des données, pas seulement sur leur moyenne.
Statistiques résumées
Les statistiques résumées compressent un jeu de données en chiffres tels que la moyenne, la variance, la corrélation ou la droite de régression. Elles sont utiles, mais elles peuvent masquer la forme, les valeurs aberrantes, les regroupements et les relations courbées qu'un graphique révélerait immédiatement.