Math Says Yes
Lección

La muestra que ves importa

Tu conclusión puede ser errónea cuando los datos que ves excluyen casos faltantes importantes.
Por el equipo editorial de Math Says Yes
Revisado por humanos según nuestros estándares de fuentes y corrección.
Cómo revisamos el contenido
Una ventana resaltada que muestra solo una parte de una muestra oculta más grande.

Una muestra es un filtro

Cada conjunto de datos llega a ti a través de un proceso de recolección. Ese proceso filtra quién está incluido, quién está excluido, quién responde, quién sobrevive, quién es visible y quién se mide con precisión. Una puede ser enorme y aun así estar sesgada si el filtro apunta en la dirección incorrecta. Por lo tanto, la primera pregunta no es cuántas observaciones hay, sino si las observaciones representan a la que quieres describir.

Los casos faltantes contienen información

El es poderoso porque los casos ausentes suelen ser exactamente aquellos que cambiarían la conclusión. Las empresas quebradas faltan en los consejos para fundadores. Las personas a las que no les gustó un producto quizás nunca dejen una reseña. Los aviones dañados que no regresaron no pueden ser inspeccionados. Cuando la ausencia está relacionada con el resultado, los datos visibles no solo tienen lagunas, sino que apuntan en una dirección sistemáticamente engañosa.

La precisión no soluciona el sesgo

Una sesgada puede producir gráficos limpios, intervalos de confianza estrechos y resultados reproducibles mientras sigue respondiendo a la pregunta incorrecta. Más datos reducen el ruido aleatorio, pero no reparan automáticamente un método de recolección distorsionado. Si una encuesta solo llega a una audiencia, agregar más personas de esa misma audiencia hace que la estimación parezca más segura, no más representativa. La calidad del muestreo es un problema de diseño antes de ser un problema de cálculo.

Cómo inspeccionar una muestra

Antes de confiar en una afirmación, rastrea el camino desde la hasta los datos. ¿Quién tuvo la oportunidad de ser incluido? ¿Quién tuvo una razón para no responder? ¿Qué fallas, usuarios silenciosos, grupos pequeños o casos límite son invisibles? Luego pregunta si los grupos faltantes probablemente tendrían resultados diferentes a los de los grupos visibles. Si la respuesta es sí, trata la conclusión como una afirmación sobre la , no sobre toda la población.

Preguntas frecuentes

¿Puede una muestra muy grande seguir estando sesgada?

Sí. El tamaño reduce el error aleatorio, pero no soluciona un proceso de recolección que excluye o sobrerrepresenta sistemáticamente a grupos importantes.

¿Cuál es la forma más sencilla de detectar el sesgo de muestreo?

Pregunta quién falta y si sus resultados diferirían. Si los casos faltantes no son aleatorios, la muestra visible puede describirse a sí misma más que a la población en general.

Comprobación rápida

¿Por qué un nombre reunido de todas las listas de amigos puede parecer más popular que una persona al azar?