Una muestra pequeña puede alejarse mucho de la verdad solo por suerte, mientras que una más grande promedia esa suerte. Esta lección muestra cómo la dispersión se reduce con la raíz cuadrada del tamaño de la muestra y por qué los grupos más pequeños dominan los extremos de cualquier clasificación.
Por el equipo editorial de Math Says Yes
Revisado por humanos según nuestros estándares de fuentes y corrección.
Cualquier tasa medida es una mezcla del valor subyacente real y el ruido aleatorio. Con solo unas pocas observaciones, el ruido tiene una voz fuerte: un solo caso inusual puede desviar el resultado lejos de la verdad. A medida que añades más observaciones, los máximos afortunados y los mínimos desafortunados comienzan a cancelarse, y el se establece más cerca del valor real. Esta es la en su forma cotidiana. Una más grande no es solo un poco más confiable; elimina activamente mediante promedios la suerte que domina a una pequeña, por lo que debes confiar mucho más en una tasa basada en miles que en la misma tasa basada en una docena.
La regla de la raíz cuadrada
La oscilación de una no se reduce al mismo paso que el ; se reduce con su raíz cuadrada. Más o menos, la distancia típica desde la verdad escala como uno entre la raíz cuadrada de n. Eso tiene un significado práctico directo: para cortar la oscilación a la mitad, no necesitas el doble de datos, necesitas cuatro veces más. Para reducirla a un tercio, necesitas nueve veces más. Por esto los datos iniciales son tan volátiles y las primeras cien respuestas a una encuesta oscilan mucho más que las mil siguientes. Cada nueva observación ayuda, pero con rendimientos decrecientes, por lo que la precisión es costosa y las muestras pequeñas siguen siendo tercamente ruidosas.
Clasificación de unidades pequeñas
Siempre que clasifiques lugares, escuelas, hospitales o equipos por una tasa, los extremos de la lista suelen ser las unidades más pequeñas, no las especiales. Un pueblo de dos cientos habitantes puede registrar la tasa de enfermedad más alta o más baja de un país en el mismo año, simplemente porque uno o dos casos mueven su tasa enormemente. Una gran ciudad nunca puede oscilar tanto, porque su enorme denominador la mantiene cerca del . Así que una clasificación de tasas de arriba a abajo a menudo se convierte en una clasificación de quién es el más pequeño, disfrazada de una clasificación de quién es el mejor o el peor. El patrón es tan confiable que ver unidades diminutas en ambos extremos es una pista de que las diferencias son principalmente ruido.
El hábito
El remedio es un pequeño hábito: lee el denominador antes de reaccionar ante la tasa. Siempre que un porcentaje, una cifra per cápita o una clasificación aparezca frente a ti, pregunta en cuántos casos y en cuántas personas se basa. Una tasa sorprendente construida sobre cinco casos merece un encogimiento de hombros, no un titular. Cuando comparas unidades de tamaños muy diferentes, ayuda encoger las tasas de muestras pequeñas más ruidosas hacia el general antes de clasificarlas, lo que evita que los grupos diminutos secuestren ambos extremos de la lista. El número de arriba es la tasa, pero el número de abajo es el que te dice si debes creerla.
Preguntas frecuentes
¿Cómo afecta el tamaño de la muestra a la dispersión de una tasa?
Con pocas observaciones, un solo caso inusual mueve la tasa un largo trecho, por lo que una muestra pequeña puede terminar muy por encima o muy por debajo del valor verdadero solo por casualidad. Las muestras grandes absorben esos casos individuales, por lo que sus tasas se mantienen cerca de la verdad y rara vez alcanzan los extremos.
¿Por qué recopilar más datos hace que una tasa sea más confiable?
Indica que a medida que recopilas más observaciones, el promedio de tu muestra se acerca constantemente al promedio real y las oscilaciones aleatorias se reducen. Cuanto mayor es la muestra, más se cancela la suerte, por lo que una tasa proveniente de miles de casos es mucho más confiable que la misma tasa proveniente de un puñado.
Saca varias muestras de lanzamientos de una moneda justa y observa la dispersión.
50 pts
dispersión de la tasa de caras
lanzamientos por muestra: 10
Con 10 lanzamientos por muestra, los doce sorteos se extienden en 50 puntos porcentuales. Las muestras pequeñas se alejan mucho del 50 % solo por suerte; añade lanzamientos y esa dispersión se reduce hacia cero.
Comprobación rápida
¿Por qué los pueblos más pequeños suelen aparecer TANTO en la parte alta como en la baja de una clasificación de "tasa por 100.000"?
A
Las poblaciones diminutas se desvían mucho de la tasa real por azar.
B
Los pueblos pequeños son genuinamente más sanos y más enfermizos que las grandes ciudades.
C
Las tasas por 100.000 solo funcionan para las grandes ciudades.