El teorema del límite central hace que los promedios parezcan normales
Los datos individuales pueden estar sesgados o ser desordenados, mientras que los promedios de muchas observaciones independientes a menudo forman un patrón limpio en forma de campana.
El teorema del límite central explica por qué los promedios suelen ser más fáciles de modelar que las observaciones individuales, incluso cuando los datos brutos no tienen una distribución normal.
Por el equipo editorial de Math Says Yes
Revisado por humanos según nuestros estándares de fuentes y corrección.
Creer que el teorema dice que los datos originales son normales, cuando en realidad trata sobre la distribución de promedios repetidos.
La parte sorprendente
Muchos conjuntos de datos reales no tienen forma de campana. Las compras están sesgadas, los tiempos de espera se extienden hacia la derecha y los recuentos sociales pueden tener colas largas. Sin embargo, si tomas muestras repetidamente y promedias cada , la de esos promedios a menudo adquiere forma de campana. Las observaciones originales siguen siendo desordenadas. El proceso de promediado crea un patrón de muestreo más limpio.
Lo que muestran los números
0
30
60
90
compras individuales
promedios de 50 compras
monto de la compra →
Las compras individuales están sesgadas. Los promedios repetidos de 50 compras forman una campana alrededor del promedio de aproximadamente 30.
Qué dice el teorema
Promedia suficientes cantidades aleatorias independientes (lanzamientos de dados, errores de medición, montos de compras diarias) y, bajo condiciones amplias, el resultado tiende hacia una después de la escala adecuada. Las condiciones exactas importan, pero la intuición es simple: cada observación empuja el un poco. Cuando muchos pequeños empujes independientes se combinan, su error total tiene una forma estable. Esa forma estable es la razón por la cual los errores estándar y los intervalos de confianza basados en la normalidad son comunes.
Lo que no dice
El teorema no hace que cada pequeño conjunto de datos sea seguro de tratar como normal. No borra la dependencia, el de selección o una gran observación que domina el . Tampoco dice que las personas, compras o eventos individuales estén normalmente distribuidos. La forma normal pertenece al promedio repetido bajo las condiciones adecuadas. Confundir esos dos niveles es el error común. El teorema explica el error del promedio, no la forma de cada observación.
Cómo usarlo
Usa el cuando la pregunta sea sobre un o total y las observaciones sean razonablemente independientes. Verifica el y si los valores atípicos dominan el resultado. Si las condiciones parecen razonables, la incertidumbre basada en la normalidad puede ser una aproximación práctica. Si no lo son, simula el proceso de muestreo o usa métodos diseñados para , dependientes o con colas pesadas. Las condiciones deciden si el atajo es justo.
Ejemplo práctico
Los montos de compra diarios en una tienda pueden estar fuertemente sesgados: muchas compras pequeñas y algunas muy grandes. Una sola compra no tiene forma de campana. Pero si tomas muestras repetidamente de 50 compras y promedias cada , esos promedios muestrales pueden agruparse de una manera mucho más regular y parecida a una campana. El teorema trata sobre ese patrón de repetido, no sobre forzar a que los montos de compra originales se vean normales.
Cuándo se aplica
El es una aproximación potente, no un hechizo mágico. Funciona mejor cuando las observaciones son razonablemente independientes, ninguna observación individual domina el total y el es lo suficientemente grande para la en cuestión. Las colas pesadas, la dependencia, el muestreo agrupado y la fuerte selección pueden ralentizar o romper la aproximación. En esos casos, la simulación, el remuestreo o un modelo adaptado a la forma de los datos pueden ser más seguros.
En qué se equivocan las personas
Las personas a menudo convierten el teorema en "las muestras grandes hacen que los datos sean normales" o "n = 30 siempre es suficiente". El teorema es más estrecho y útil que eso. Describe la de sumas o promedios bajo condiciones. No garantiza que las observaciones originales, las muestras sesgadas o los datos dependientes se comporten normalmente.
Nota sobre la fuente
El relato histórico de Le Cam respalda la idea de la página de que el es una familia de resultados matemáticos precisos con condiciones, y no una regla casual en la que todos los datos se vuelven normales. La fuente de referencia ofrece la afirmación estándar; la fuente confiable sustenta la precaución sobre la interpretación del teorema al nivel correcto.
Preguntas frecuentes
¿Se aplica el teorema del límite central a muestras pequeñas?
A veces, pero no automáticamente. La aproximación funciona mejor con muestras más grandes y colas más débiles, y peor cuando las observaciones son dependientes o están dominadas por valores extremos.
¿Por qué es importante el teorema del límite central para los intervalos de confianza?
A menudo justifica el uso de una distribución muestral con forma normal para un promedio, lo que hace que los errores estándar y los intervalos de confianza sean prácticos incluso cuando las observaciones originales no son normales.
Comprobación rápida
¿Qué ayuda a explicar el teorema del límite central?
A
Los valores atípicos desaparecen automáticamente en muestras pequeñas.
B
Los promedios de muchas observaciones independientes tienden hacia una forma de campana.
C
Cada conjunto de datos del mundo real tiene forma de campana.