Una distribución es cómo se reparte la probabilidad
La lección pasada dijimos que la probabilidad es área. Pero hablar solo de la probabilidad de un único evento es la mitad de la imagen. Lo que de verdad queremos saber es qué valores salen con qué frecuencia — cómo se reparte la probabilidad sobre los valores posibles. La forma entera de ese reparto es la distribución. La suma de dos dados sale cerca de 7 a menudo, mientras que 2 o 12 son raros. Todo este mapa de "a menudo y rara vez" es la distribución, y dibujado como gráfico de barras muestra un pico. Cuando los valores son discretos, separados, cada barra es una probabilidad; cuando los valores son continuos, las barras se vuelven infinitamente densas y se convierten en una curva suave, una densidad. Y aquí está el punto decisivo. Para una distribución continua, la altura de la curva no es la probabilidad — el área bajo la curva es la probabilidad. El "área = probabilidad" de E1 se traslada directamente. En esta lección dibujarás una distribución de barras a curva y luego a área, aprendiendo a ojo cómo se reparte la probabilidad.
Primero, la distribución discreta, donde los valores están separados. Un dado da del 1 al 6 por igual, 16 cada uno — seis barras una junto a otra a la misma altura. Pero mira la suma de dos dados y la forma cambia bruscamente. Una suma de 7 ocurre como (1,6)(2,5)(3,4)(4,3)(5,2)(6,1), seis maneras, mientras que una suma de 2 ocurre solo como (1,1), una manera. Así que 7 es alta con 636 y 2 y 12 son bajas con 136 — un triángulo que se abulta en el medio. La altura de cada barra es la probabilidad de ese valor, y esto se llama la función de masa de probabilidad, la PMF. Toca una barra para comprobar la probabilidad de cada valor. La clave es que sumar todas las alturas de las barras da exactamente 1, porque algún valor tiene que salir. Una distribución es precisamente "cómo se reparte la probabilidad total de 1 entre los valores posibles."
¿Y si los valores son continuos? Cuando los resultados corren sin huecos, como estaturas, pesos o errores de medición. Entonces contar barras una por una no tiene sentido, porque la probabilidad de exactamente 173.4825...cm es esencialmente cero. En su lugar reunimos muestras, las agrupamos en intervalos y dibujamos un histograma. Usa el deslizador para aumentar el tamaño muestral N. Cuando N es pequeño las barras son dentadas y rugosas, pero a medida que N crece la irregularidad del azar se promedia y desaparece, y el contorno de las barras se acerca a una sola curva suave. Esta curva es la función de densidad de probabilidad. El histograma es una aproximación a partir de muestras finitas, y la forma ideal, con infinitas muestras reunidas, es exactamente la curva de densidad. Así que la curva de densidad es "la PMF cuando los valores son continuos," una versión suave de barras rebanadas infinitamente finas y unidas. Cuanta más data reúnes, más se revela la verdadera distribución escondida detrás de esos datos.
¿Cómo lees una probabilidad de la curva de densidad? Aquí es donde la gente se confunde más. La altura de la curva no es la probabilidad — en el caso continuo la probabilidad de un único punto es 0. En su lugar, la probabilidad se lee como el área bajo la curva. "La probabilidad de que X esté entre a y b" es el área bajo la curva de a a b. Arrastra los dos límites a y b para ensanchar el intervalo entre ellos. A medida que el área crece, esa probabilidad crece. Incluye el centro alto bajo el pico y el área es grande para un ancho dado, mientras que la cola plana da poca área para el mismo ancho — por lo que los valores del centro salen más a menudo. El área bajo toda la curva es exactamente 1, igual que todo el tablero era 1 en E1. Al final, la probabilidad de una distribución continua es medir área — es decir, integración. La integral del cálculo se usa en probabilidad exactamente así.
Las distribuciones se clasifican por la forma de su reparto, y cada forma encaja en ciertas situaciones. Usa las pestañas para ver tres distribuciones representativas. La distribución uniforme es una curva rectangular y plana. Encaja cuando cualquier cosa dentro de un intervalo fijo es igualmente probable — por ejemplo los números aleatorios que genera una computadora, o el error de redondeo. La distribución exponencial es más alta al principio y cae bruscamente hacia la derecha. Aparece para el tiempo de espera hasta el próximo evento, el tiempo hasta que una pieza falla, el intervalo entre clientes que llegan — casos donde "las esperas cortas son comunes y las largas son raras." La distribución normal es la famosa forma de campana, más alta en el medio y cayendo suave y simétricamente. Estaturas, puntuaciones de examen, error de medición — casi todo reparto natural que surge de muchos factores pequeños sumados tiene esta forma. Conocer la forma de una distribución te deja anticipar de antemano cómo se comportarán los datos.
Por último, hay otra imagen que se empareja con la densidad: la función de distribución acumulada, la CDF. Si la densidad muestra "cuánta probabilidad se concentra cerca de cada valor," la CDF muestra "la probabilidad de obtener un valor menor o igual a x" — la probabilidad acumulada apilada desde el extremo izquierdo hasta x. La imagen lo deja claro. Arriba está la curva de densidad, abajo la CDF. Arrastra x, y arriba se sombrea el área hasta x, mientras que abajo ese valor de área se marca como un solo punto. Así que CDF(x) es exactamente el área bajo la curva de densidad hasta x. Mueve x del extremo izquierdo al derecho y vas barriendo cada vez más área, así que la CDF empieza en 0 y sube hasta 1, sin bajar ni una vez. Sobre los intervalos donde el pico de la densidad es alto la CDF sube de forma empinada, y sobre las colas sube suavemente. Las dos curvas son una pareja, la misma distribución vista de dos modos: la densidad es la pendiente, la CDF es esa pendiente acumulada en área. La relación entre derivada e integral se mantiene aquí también.