Math Says Yes
Collection

Trucs de données et statistiques trompeuses

Exemples de graphiques, moyennes, corrélations, valeurs p et échantillons pouvant induire en erreur sans mensonge évident.
Une mauvaise interprétation des données s'annonce rarement. Un graphique peut rogner l'axe, une moyenne peut masquer la distribution, une corrélation peut provenir d'une cause commune, et une valeur p peut être traitée comme une preuve alors qu'elle n'est qu'un indice.
Cette collection est une initiation pratique à la culture des données : comment examiner une affirmation, demander le dénominateur, vérifier l'échantillon et chercher l'image cachée derrière le chiffre récapitulatif. Elle est conçue pour les moments où un graphique ou un titre semble précis, mais où tu as besoin de savoir si cette précision est méritée.
Utilise les pages ensemble. Un graphique trompeur, une interprétation faible de la valeur p et un échantillon biaisé sont des modes d'échec différents, mais ils apparaissent souvent dans le même article, rapport, tableau de bord ou argumentaire.

Une liste de contrôle rapide pour toute affirmation

Demande : comparé à quoi, mesuré comment et sélectionné parmi qui ? Demande ensuite si le chiffre est un décompte, un taux, une moyenne, une estimation de modèle ou le résultat d'un test statistique. La plupart des statistiques trompeuses deviennent plus faciles à repérer une fois que le dénominateur, l'échantillon et l'incertitude sont visibles.

Les graphiques et les résumés ont besoin l'un de l'autre

Les axes tronqués montrent comment un graphique peut exagérer. Le quart d'Anscombe montre le problème inverse : un tableau peut cacher la forme qu'un graphique révèle. L'habitude la plus sûre est d'utiliser les deux. Laisse le graphique montrer la structure, puis laisse le résumé quantifier ce que suggère le graphique.

La preuve n'est pas la certitude

Les valeurs p, les intervalles de confiance, le biais de publication et les petits échantillons pointent tous vers la même règle : une preuve a une force, une direction et une incertitude. Un résultat peut être intéressant sans être définitif. Un lecteur responsable se demande à quel point l'estimation est bruitée et quelles preuves manqueraient si l'affirmation était plus faible qu'elle n'en a l'air.

Faits mis en avant

Trucs de données
4 min · facile
Deux barres presque égales qui paraissent spectaculairement différentes une fois la base du graphique coupée.
Un graphique peut induire en erreur sans un seul faux chiffre
Commence l'axe d'un graphique à barres à 95 au lieu de 0 et un changement de deux points peut ressembler à un raz-de-marée.
Trucs de données
4 min · facile
Beaucoup de silhouettes courtes et quelques très hautes, avec une ligne pointillée de moyenne située au-dessus de la plupart d'entre elles.
La plupart des gens gagnent moins que le salaire moyen
Dans une économie déséquilibrée, une poignée de revenus astronomiques tire la « moyenne » au-dessus de ce qu'une personne typique gagne réellement.
Trucs de données
4 min · facile
Un cornet de crème glacée et des vagues de l'océan reliés par une ligne pointillée, avec un soleil au-dessus relié aux deux.
Est-ce que la crème glacée cause des noyades ?
Imagine un graphique saisonnier où les ventes de crème glacée et les noyades augmentent ensemble. Le dessert paraît suspect, mais le graphique seul ne peut pas montrer la cause.
Trucs de données
4 min · moyen
Une petite étiquette de valeur p à côté d'une courbe de modèle nul avec la queue mise en surbrillance.
Une valeur p n'est pas la probabilité que ton résultat soit faux
Une valeur p est un test de surprise : elle demande à quelle fréquence un résultat aussi extrême apparaîtrait s'il n'y avait vraiment aucun effet. Elle ne t'indique pas la probabilité que ton résultat soit faux.
Trucs de données
4 min · moyen
Plusieurs barres d'intervalle autour d'une ligne cible, la plupart des barres croisant la cible et une la manquant.
Un intervalle de confiance à 95 % n'est pas une promesse à 95 %
Un intervalle de confiance à 95 % signifie que la méthode fonctionne 95 % du temps lors d'échantillons répétés, et non que cette plage exacte a maintenant 95 % de chances de contenir la vérité.
Trucs de données
4 min · facile
Quatre mini-nuages de points montrant des formes différentes sous la même ligne récapitulative.
Le quartette d'Anscombe présente les mêmes statistiques mais des histoires différentes
Quatre jeux de données peuvent partager presque la même moyenne arithmétique, la même variance, la même corrélation et la même droite de régression, tout en ayant des apparences complètement différentes une fois tracés.
Trucs de données
4 min · moyen
Une pile d'études positives publiées sur un bureau et des études aux résultats nuls dissimulées dans un tiroir.
Le biais de publication cache les études qui n'ont rien trouvé
Si seuls les résultats stimulants sont publiés, la recherche visible peut donner à un effet l'air plus net et plus fort qu'il ne l'est réellement.
Trucs de données
4 min · facile
La silhouette d'un avion recouverte de points représentant des impacts de balles sur les ailes et la queue, les moteurs restant intacts.
Les avions manquants étaient les plus importants
Si tu ne renforces que les impacts de balles sur les avions qui reviennent, tu risques de protéger aux mauvais endroits.
Trucs de données
5 min · facile
Des barres allant de courtes à hautes, un pointeur sur la barre du milieu et une ligne pointillée se trouvant bien au-dessus de la plupart d'entre elles.
Moyenne vs médiane : quelle moyenne dois-tu utiliser ?
La moyenne partage le total de manière égale. La médiane trouve le cas du milieu. Dans des données biaisées, celles-ci peuvent raconter des histoires très différentes.
Trucs de données
5 min · facile
Deux engrenages qui ne se touchent jamais, tous deux entraînés par un troisième engrenage en dessous par des courroies.
Corrélation et causalité : pourquoi évoluer ensemble ne prouve rien
La corrélation indique que deux choses évoluent ensemble. La causalité indique que l'une modifie l'autre. Un troisième facteur caché peut donner l'illusion d'une causalité.
Trucs de données
5 min · moyen
Une barre de plage horizontale avec un point central sur la gauche, et une ligne de seuil en pointillé avec un marqueur la traversant sur la droite.
Valeur p et intervalle de confiance : ce que chacun vous apprend
Une valeur p se demande si les données semblent surprenantes sous un modèle nul. Un intervalle de confiance demande quelles tailles d'effet restent plausibles.
Trucs de données
5 min · facile
Un large nuage de points dispersés à gauche et une barre d'erreur resserrée autour d'un point unique à droite.
Erreur type et écart-type : dispersion et précision
L'écart-type décrit la dispersion parmi les valeurs individuelles. L'erreur type décrit l'incertitude d'une estimation telle que la moyenne.
Trucs de données
4 min · moyen
Des barres descendantes inégales s'intercalent entre des reçus abstraits et des documents de données.
Le chiffre 1 est curieusement fréquent
Dans de nombreux jeux de données du monde réel, les nombres commencent par 1 bien plus souvent que par 9 — environ 30,1 % du temps.
Psychologie des nombres
4 min · facile
Une roue de la fortune en train de tourner et attirant la bulle de pensée d'une personne vers elle.
Un nombre aléatoire peut influencer ton estimation
Fais tourner une roue pour obtenir un nombre aléatoire, puis demande aux gens d'estimer un fait : ceux qui ont vu un nombre plus grand devinent plus grand, même lorsque le nombre est manifestement dénué de sens.

Concepts

Les moyennes trompent
La moyenne arithmétique additionne tout et divise, de sorte que quelques valeurs extrêmes peuvent l’éloigner fortement du cas typique. Dans des données asymétriques, la médiane — la valeur du milieu — représente mieux ce qui est normal. Renseigne-toi sur la forme des données, pas seulement sur leur moyenne.
Corrélation et causalité
Le fait que deux choses évoluent ensemble ne signifie pas que l’une cause l’autre. Un troisième facteur de confusion peut être à l’origine des deux, ou le lien peut être une coïncidence. Établir la causalité nécessite plus qu’une corrélation — généralement une comparaison contrôlée.
Valeurs p
Une valeur p est la probabilité d'observer des données au moins aussi extrêmes si un modèle nul spécifique était vrai. Ce n'est pas la probabilité que l'affirmation soit fausse, ni la chance que le résultat soit aléatoire, ni une mesure de l'ampleur ou de l'importance de l'effet.
Statistiques résumées
Les statistiques résumées compressent un jeu de données en chiffres tels que la moyenne, la variance, la corrélation ou la droite de régression. Elles sont utiles, mais elles peuvent masquer la forme, les valeurs aberrantes, les regroupements et les relations courbées qu'un graphique révélerait immédiatement.
Biais de publication
Le biais de publication se produit lorsque des études aux résultats stimulants ou statistiquement significatifs ont plus de chances d'être publiées, partagées ou remarquées que des études aux résultats nuls. La littérature visible peut alors exagérer la force réelle d'un effet.
Intervalles de confiance
Un intervalle de confiance est une plage produite par une méthode qui capture la vraie valeur une proportion définie du temps sur des échantillons répétés. Il décrit l'incertitude de la méthode d'estimation, et non une garantie personnelle qu'un intervalle déjà calculé contient la vérité.
Erreur type
L'erreur type est la fluctuation d'échantillonnage typique d'une estimation telle qu'une moyenne. Pour des observations indépendantes, l'erreur type d'une moyenne diminue avec la racine carrée de la taille de l'échantillon, de sorte que diviser l'erreur par deux nécessite généralement quatre fois plus de données.
Écart-type
L'écart-type décrit la dispersion des observations individuelles autour de leur moyenne. Il concerne la variation au sein des données elles-mêmes. L'erreur type est différente : elle décrit à quel point une estimation telle que la moyenne de l'échantillon varierait sur des échantillons répétés.