Chaque ensemble de données te parvient par le d'un processus de collecte. Ce processus filtre qui est inclus, qui est exclu, qui répond, qui survit, qui est visible et qui est mesuré avec précision. Un peut être énorme et tout de même biaisé si le filtre pointe dans la mauvaise direction. La première question n'est donc pas de savoir combien il y a d'observations, mais si les observations représentent la que tu veux décrire.
Les cas manquants portent des informations
Le est puissant parce que les cas absents sont souvent exactement ceux qui changeraient la conclusion. Les entreprises en faillite sont absentes des conseils aux fondateurs. Les personnes qui n'ont pas aimé un produit ne laissent peut-être jamais d'avis. Les avions endommagés qui ne sont pas revenus ne peuvent pas être inspectés. Lorsque l'absence est liée au résultat, les données visibles ne présentent pas seulement des lacunes. Elles pointent dans une direction systématiquement trompeuse.
La précision ne corrige pas le biais
Un é peut produire des graphiques nets, des intervalles de confiance étroits et des résultats reproductibles tout en répondant à la mauvaise question. Davantage de données réduisent le bruit aléatoire, mais elles ne réparent pas automatiquement une méthode de collecte faussée. Si une enquête ne touche qu'un seul public, ajouter plus de personnes de ce même public rend l'estimation plus confiante, pas plus représentative. La qualité de l'échantillonnage est un problème de conception avant d'être un problème de calcul.
Comment inspecter un échantillon
Avant de faire confiance à une affirmation, retrace le chemin de la aux données. Qui a eu une d'être inclus ? Qui a eu une raison de ne pas répondre ? Quels échecs, utilisateurs discrets, petits groupes ou cas particuliers sont invisibles ? Demande-toi ensuite si les groupes manquants auraient probablement des résultats différents de ceux des groupes visibles. Si la réponse est oui, traite la conclusion comme une déclaration concernant l', et non toute la population.
FAQ
Un très grand échantillon peut-il être biaisé ?
Oui. La taille réduit l'erreur aléatoire, mais elle ne corrige pas un processus de collecte qui exclut ou surreprésente systématiquement des groupes importants.
Quelle est la manière la plus simple de repérer le biais d’échantillonnage ?
Demande qui manque et si leurs résultats différeraient. Si les cas manquants ne sont pas aléatoires, l'échantillon visible peut se décrire lui-même plus que la population plus large.