Math Says Yes
Leçon

L'échantillon que tu vois compte

Ta conclusion peut être erronée lorsque les données que tu vois excluent des cas manquants importants.
Par l'équipe de rédaction de Math Says Yes
Examiné par des humains selon nos normes en matière de sources et de corrections.
Comment nous évaluons le contenu
Une fenêtre en surbrillance montrant seulement une partie d'un échantillon plus grand et caché.

Un échantillon est un filtre

Chaque ensemble de données te parvient par le d'un processus de collecte. Ce processus filtre qui est inclus, qui est exclu, qui répond, qui survit, qui est visible et qui est mesuré avec précision. Un peut être énorme et tout de même biaisé si le filtre pointe dans la mauvaise direction. La première question n'est donc pas de savoir combien il y a d'observations, mais si les observations représentent la que tu veux décrire.

Les cas manquants portent des informations

Le est puissant parce que les cas absents sont souvent exactement ceux qui changeraient la conclusion. Les entreprises en faillite sont absentes des conseils aux fondateurs. Les personnes qui n'ont pas aimé un produit ne laissent peut-être jamais d'avis. Les avions endommagés qui ne sont pas revenus ne peuvent pas être inspectés. Lorsque l'absence est liée au résultat, les données visibles ne présentent pas seulement des lacunes. Elles pointent dans une direction systématiquement trompeuse.

La précision ne corrige pas le biais

Un é peut produire des graphiques nets, des intervalles de confiance étroits et des résultats reproductibles tout en répondant à la mauvaise question. Davantage de données réduisent le bruit aléatoire, mais elles ne réparent pas automatiquement une méthode de collecte faussée. Si une enquête ne touche qu'un seul public, ajouter plus de personnes de ce même public rend l'estimation plus confiante, pas plus représentative. La qualité de l'échantillonnage est un problème de conception avant d'être un problème de calcul.

Comment inspecter un échantillon

Avant de faire confiance à une affirmation, retrace le chemin de la aux données. Qui a eu une d'être inclus ? Qui a eu une raison de ne pas répondre ? Quels échecs, utilisateurs discrets, petits groupes ou cas particuliers sont invisibles ? Demande-toi ensuite si les groupes manquants auraient probablement des résultats différents de ceux des groupes visibles. Si la réponse est oui, traite la conclusion comme une déclaration concernant l', et non toute la population.

FAQ

Un très grand échantillon peut-il être biaisé ?

Oui. La taille réduit l'erreur aléatoire, mais elle ne corrige pas un processus de collecte qui exclut ou surreprésente systématiquement des groupes importants.

Quelle est la manière la plus simple de repérer le biais d’échantillonnage ?

Demande qui manque et si leurs résultats différeraient. Si les cas manquants ne sont pas aléatoires, l'échantillon visible peut se décrire lui-même plus que la population plus large.

Vérification rapide

Pourquoi un nom regroupé à partir de toutes les listes d'amis peut-il paraître plus populaire qu'une personne prise au hasard ?