3.4 ¿De dónde sale la fórmula de la distribución Normal?
En los libros de estadística es fácil encontrarse con la famosa –y también curiosa, ya que incluye los números \(\pi\) y \(e\)– función densidad de probabilidad de la distribución Normal. Lo que no es tan fácil es encontrar una explicación de cómo se obtiene. Se puede llegar a ella de una manera formal por diferentes vías, pero ninguna es fácil y nosotros tampoco vamos a emprender ese camino1. Jugando con la ventaja de saber dónde queremos llegar, nos vamos a conformar con justificar que es muy razonable que esa función sea como es.
Para ello hemos construido un histograma con 10.000 valores generados aleatoriamente de una distribución Normal con media \(\mu\) =10 y desviación típica \(\sigma\)=2 (estos valores son arbitrarios, podrían ser otros) y vamos a intentar llegar a la función que da el perfil suavizado de este histograma.
La primera observación que puede hacerse es que la forma de caída del histograma a ambos lados recuerda la función exponencial. La parte de la izquierda, en que la función es creciente, podría ser de la forma \(f(x)=e^x\) , pero para poder representar la parte derecha de forma simétrica, utilizaremos la función \(f(x)=e^{x-10}\) para la parte creciente de la izquierda y \(f(x)=e^{10-x}\) para la parte de la derecha.
Ahora debemos colocar en una sola función la parte creciente y la decreciente. Esto se consigue mediante la expresión \(f(x)=e^{-\vert x-10 \vert}\).
Ya tenemos una función que tiene una forma parecida a la Normal en las colas pero que presenta un pico en su máximo. Este pico, punto en que la función no tiene derivada, provoca el mal comportamiento característico de la función valor absoluto. Por tanto, si el problema está en la expresión \(\vert x-10 \vert\) es razonable pensar en sustituirla por el cuadrado de la diferencia: \((x-10)^2\).
La figura 4 muestra la función \(f(x) = e^{-(x-10)^2}\) superpuesta con el histograma de los datos. Vamos por buen camino, efectivamente el pico ha desaparecido y ya tenemos forma de campana, aunque ahora se trata de ensancharla.
Ensanchar la campana significa aumentar el valor de las ordenadas para \(x\neq 10\) manteniendo la forma de la función. Esto se consigue dividiendo el exponente por una constante que depende de la variabilidad de los datos y, por tanto, de \(\sigma\). Se pueden hacer pruebas para deducir ese valor y resulta ser \(2 \sigma^{2}\).
En la figura 5 tenemos la superposición de la función \(f(x) = e^{- \frac{(x - \mu)^2}{2 \sigma^2}}\) (en la que \(\mu\) = 10 y \(\sigma\) = 2) con el histograma de los datos.
El ajuste es excelente, pero esta no es la función densidad de probabilidad de la distribución Normal. En realidad no es ni una función densidad de probabilidad. Para serlo es necesario que el área bajo la curva sea igual a 1 y en nuestra función esto no es así.
Si el área es igual a \(K\) entonces \(\frac{1}{K}f(x)\) mantendrá la misma forma y con las mismas proporciones, ya que solo cambia un factor de escala en el eje de ordenadas, y ahora el área sí será igual a 1.
Para saber cuánto vale \(K\) solo hay que integrar nuestra función. Se puede hacer en una página web con calculadora de integrales (nosotros hemos usado calculadora-de-integrales.com) y se obtiene:
\[ \int_{-\infty}^{\infty} e^{- \frac{(x - \mu)^2}{2 \sigma^2}} = \sigma \sqrt{2 \pi} \]
Ahora sí hemos llegado a la fórmula que buscábamos:
\[ f(x) = \frac{1}{\sigma \sqrt{2 \pi}} e^{-\frac{(x-\mu)^2}{2 \sigma^2}} \]
No podemos acabar diciendo aquello de “como queríamos demostrar” pero esperamos que ahora esta expresión se vea más justificada.
Si está interesado en un enfoque más formal, aunque también en tono de divulgación, le gustará el artículo: “The Evolution of the Normal Distribution” de Sal Stahl, en Mathematics Magazine Vol. 79, núm. 2, abril de 2006.}.↩︎