Math Says Yes

Glosario

Busca 51 términos de estadística y 32 ideas en un lenguaje sencillo.

Términos

Definiciones rápidas de las palabras que usa la estadística.

Ideas

Las ideas más grandes detrás de los datos, explicadas en un lenguaje sencillo.
Riesgo absoluto frente a riesgo relativo
Un cambio relativo («50 % más», «duplica tu riesgo») oculta cuán grande es realmente el riesgo subyacente. Un gran incremento relativo en una tasa base diminuta sigue siendo diminuto. Pide siempre los números absolutos (cuántos de cada 100 antes y después), no solo el cambio porcentual.
Anclaje
Un número inicial, incluso uno arbitrario o irrelevante, atrae las estimaciones posteriores hacia sí. Las personas se alejan muy poco del ancla, por lo que el punto de partida moldea silenciosamente el juicio final.
Los promedios engañan
La media aritmética lo suma todo y lo divide, por lo que unos pocos valores extremos pueden alejarla mucho del caso típico. En datos sesgados, la mediana —el valor central— representa mejor lo que es normal. Pregunta por la forma de los datos, no solo por su promedio.
Tasas base
La frecuencia de fondo de algo antes de considerar nueva evidencia. Una señal fuerte aún puede producir muchas falsas alarmas cuando lo que se está probando es raro, porque hay muchos más casos que no lo son que los que sí lo son. Un buen razonamiento combina la nueva señal con la tasa base.
Teorema del límite central
El teorema del límite central establece que los promedios de muchas influencias aleatorias independientes y de tamaño similar tienden a formar una distribución de muestreo en forma de campana, incluso cuando los datos originales no tienen forma de campana. Explica por qué los promedios suelen ser más predecibles que las observaciones individuales.
Sesgo de colisión
El sesgo de colisión aparece cuando solo miras casos seleccionados por un resultado compartido, como pacientes de un hospital o solicitantes admitidos. Condicionar ese resultado compartido puede crear una relación entre causas que no estaban relacionadas en toda la población.
Comparación de riesgos
Colocar diferentes peligros en una escala común (como el micromort, una probabilidad entre un millón de morir) te permite comparar actividades honestamente, en lugar de clasificarlas según lo aterradoras que parezcan.
Probabilidad condicional
La probabilidad de que algo ocurra después de que nueva información cambie lo que sigue siendo posible. El paso importante es actualizar el denominador: los casos descartados por la nueva información ya no deben contarse. Muchos errores ocurren cuando las personas siguen usando las probabilidades originales después de que la situación se ha reducido.
Intervalos de confianza
Un intervalo de confianza es un rango producido por un método que captura el valor real una proporción establecida de las veces en muestras repetidas. Describe la incertidumbre en el método de estimación, no una garantía personal de que un intervalo ya calculado contenga la verdad.
Correlación frente a causalidad
Que dos cosas se muevan juntas no significa que una cause la otra. Una tercera variable (un factor de confusión) puede impulsar ambas, o el vínculo puede ser una coincidencia. Establecer la causalidad requiere más que una correlación, por lo general una comparación controlada.
Cancelación de errores
Cuando muchas estimaciones independientes conllevan un error aleatorio en diferentes direcciones, promediarlas cancela gran parte del error y deja la señal compartida. Algunas suposiciones quedan muy altas y otras muy bajas, por lo que los excesos y defectos se contrarrestan mutuamente en el promedio. Por esta razón, el promedio de una multitud —o una medición repetida— puede superar a la mayoría de las suposiciones individuales.
Valor esperado
El resultado promedio a largo plazo: cada resultado ponderado por su probabilidad. Te dice si una apuesta es favorable en promedio, pero ignora cuánto dolería un solo resultado poco frecuente, razón por la cual las personas pagan racionalmente para evitar pérdidas que no podrían absorber.
Crecimiento exponencial
Las cantidades que crecen en un porcentaje constante se multiplican en lugar de sumarse, por lo que cada paso es mayor que el anterior. El total se mantiene engañosamente plano durante mucho tiempo y luego entra en erupción. La duplicación es el caso más claro: cada paso es tan grande como todo lo anterior combinado.
Efectos de encuadre
Los mismos números reales pueden dar impresiones muy diferentes según cómo se presenten: rangos de ejes, líneas base, absoluto frente a relativo, o redacción. El encuadre cambia la percepción sin cambiar los hechos, así que verifica cómo se muestra un número, no solo qué es.
Ley de Goodhart
La ley de Goodhart establece que cuando una medida se convierte en un objetivo, tiende a dejar de ser una buena medida. Las personas optimizan lo que se premia, por lo que la métrica puede mejorar mientras que aquello que pretendía representar empeora.
Independencia
Los eventos independientes no se influencian mutuamente: la probabilidad del siguiente resultado es la misma sin importar lo que haya venido antes. Una moneda, un dado y una ruleta no tienen memoria de sus resultados pasados.
Ley de los grandes números
A medida que una muestra crece, su promedio se acerca al promedio real y las fluctuaciones aleatorias se reducen, aproximadamente en proporción a 1 sobre la raíz cuadrada del tamaño de la muestra. Las muestras pequeñas pueden alejarse mucho de la verdad por pura casualidad, razón por la cual un puñado de observaciones es tan fácil de malinterpretar.
Escala logarítmica
Una forma de medir el crecimiento multiplicativo, donde las distancias iguales significan proporciones iguales en lugar de diferencias iguales. Pasar de 1 a 10 es un salto del mismo tamaño que pasar de 10 a 100 porque ambos son por diez. Las escalas logarítmicas son útiles cuando las cantidades abarcan varios órdenes de magnitud.
Margen de error
Un margen de error es el rango de más o menos alrededor de una estimación de encuesta causado por la incertidumbre de muestreo. Si dos estimaciones tienen rangos de incertidumbre que se superponen, es posible que el líder aparente no esté realmente adelante.
Órdenes de magnitud
Un paso de un factor de diez. Manejamos bien las pequeñas diferencias aditivas, pero subestimamos gravemente cuán separados están los números cuando abarcan muchas decenas, razón por la cual un millón y mil millones se sienten similares a pesar de que uno es mil veces el otro.
Valores p
Un valor p es la probabilidad de ver datos al menos tan extremos si un modelo nulo específico fuera verdadero. No es la probabilidad de que la afirmación sea falsa, ni la posibilidad de que el resultado haya sido aleatorio, ni una medida de cuán grande o importante es el efecto.
Comparaciones por pares
Cuando cada elemento se puede comparar con cualquier otro, el número de pares posibles crece mucho más rápido que el número de elementos. Un grupo de n elementos tiene n x (n - 1) / 2 pares, por lo que cada nuevo elemento se conecta con todo lo que ya está allí. Esta es la razón por la cual las coincidencias se vuelven comunes antes de que cualquier comparación individual parezca probable.
Sesgo de publicación
El sesgo de publicación ocurre cuando los estudios con resultados emocionantes o estadísticamente significativos tienen más probabilidades de ser publicados, compartidos o notados que los estudios con resultados nulos. La literatura visible puede entonces exagerar cuán fuerte es realmente un efecto.
Aleatoriedad y agrupamiento
Los eventos verdaderamente aleatorios se agrupan y forman rachas mucho más de lo que la intuición espera. Las rachas y los grupos son una característica normal de la aleatoriedad, no la prueba de un patrón, una causa o una racha ganadora. Una distribución uniforme y ordenada es el resultado improbable.
Regresión a la media
Una medición extrema suele ser una mezcla de una parte estable y repetible y otra parte afortunada de una sola vez. Como la parte afortunada rara vez se manifiesta de la misma manera dos veces, la siguiente medición de lo mismo tiende a acercarse al promedio. No se trata de una fuerza que atraiga las cosas hacia el centro. Es simplemente el aspecto que tiene la selección por suerte cuando se vuelve a medir.
Sesgo de muestreo
Un resultado distorsionado causado por observar datos que no representan a la población que te importa. Más datos no solucionan el problema si todavía faltan los mismos tipos de casos. Antes de confiar en una conclusión, pregunta quién tuvo la oportunidad de aparecer en la muestra y quién quedó fuera.
Muestreo sesgado por el tamaño
Una forma de muestreo en la que la probabilidad de que se elija un elemento aumenta con su tamaño o su número de conexiones, por lo que los elementos más grandes o con más conexiones están sobrerrepresentados. Es la razón por la cual la aparición de un nombre recopilado de todas las listas de amigos parece más popular que una persona aleatoria: las personas bien conectadas aparecen en muchas listas, por lo que se seleccionan con más frecuencia. El mismo efecto hace que las clases parezca que tienen más alumnos cuando se pregunta a los estudiantes que cuando se pregunta a la administración, porque hay más alumnos en las clases grandes.
Desviación estándar
La desviación estándar describe cuán dispersas están las observaciones individuales alrededor de su media aritmética. Se trata de la variación en los propios datos. El error estándar es diferente: describe cuánto variaría una estimación como la media aritmética muestral en muestras repetidas.
Error estándar
El error estándar es la fluctuación típica de muestreo de una estimación, como una media aritmética. Para observaciones independientes, el error estándar de una media aritmética se reduce con la raíz cuadrada del tamaño de la muestra, por lo que reducir el error a la mitad suele requerir cuatro veces más datos.
Potencia estadística
La potencia estadística es la probabilidad de que un estudio detecte un efecto de un tamaño determinado si ese efecto es real. Los estudios con baja potencia pueden pasar por alto efectos reales, mientras que los estudios muy grandes pueden detectar efectos demasiado pequeños para importar en la práctica.
Estadísticas de resumen
Las estadísticas de resumen comprimen un conjunto de datos en números como la media aritmética, la varianza, la correlación o la línea de regresión. Son útiles, pero pueden ocultar formas, valores atípicos, grupos y relaciones curvas que un gráfico revelaría de inmediato.
Incertidumbre
El margen honesto que queda tras los límites de medición, las elecciones de modelos y la información faltante. Un solo número puede ser útil como punto medio, pero las decisiones suelen necesitar también valores altos y bajos plausibles. Las buenas estimaciones exponen los supuestos que moverían la respuesta.