4.4 ¿Cuántos elementos debe tener una muestra para que las conclusiones sean fiables?

En el ámbito del muestreo probabilístico, el tamaño de la muestra se calcula aplicando una fórmula que puede ser más o menos complicada, dependiendo del tipo de muestreo. En el caso del muestreo aleatorio simple y para la estimación de una proporción, \(p\), tenemos: \[ n = \frac{Np(1-p)}{(N-1)(E^2/z^2)+p(1-p)} \]

Esta fórmula se deduce a partir de la expresión del intervalo de confianza para \(p\) con la corrección para población finita. Para obtener el valor de \(n\) basta con asignar valores a las variables que intervienen. Estas variables son:

E: Margen de error

Si le piden que a través de una muestra estime la proporción de jóvenes de su ciudad que son usuarios habituales de una red social, nadie le va a exigir que dé el valor exacto, por ejemplo el 23,7 %. En su informe usted hará constar que el porcentaje estimado es de 23,7 \(\pm\) 3,3 %. El 23,7 % es la proporción obtenida en la muestra y ese 3,3 % de incertidumbre en torno al valor de la muestra es lo que llamamos margen de error. En igualdad de valores del resto de variables que intervienen, si quiere dar el resultado con menos margen de error deberá usar un mayor tamaño de muestra.

z: Relacionado con el nivel de confianza

Si llega a la conclusión de que esa proporción está en el intervalo 23,7 \(\pm\) 3,3 % ¿Puede usted afirmar con total seguridad que el verdadero valor está dentro de este intervalo? No, no puede hacerlo, su afirmación siempre tendrá un cierto nivel de confianza. Si ese nivel de confianza es del 95 % significa que el intervalo se ha construido siguiendo un procedimiento que acierta (incluye el verdadero valor) el 95 % de las veces, es como una información que da alguien que dice la verdad el 95 % de las veces. El nivel de confianza está relacionado con el valor de \(z\). Para un nivel de confianza \(1-\alpha\) el valor de \(z\) es aquel que deja un área de cola de \(\alpha/2\) en la distribución \(N(0; 1)\). Si el nivel de confianza es el 95 % tenemos que \(z_{0,025} = 1,96\) (cuando los medios de cálculo eran rudimentarios ese 1,96 se redondeaba a 2 obteniéndose un nivel de confianza del 95,5 %). ¿Podemos construir el intervalo de manera que acierte el 99 % de las veces? Sí podemos, incluso podemos lograr que acierte el 99,99 %, pero no lo hacemos porque al aumentar el nivel de confianza aumenta también el margen de error y podemos llegar a la conclusión de que el porcentaje que andamos buscando está en el intervalo 23,7 \(\pm\) 20 %. De eso estaremos muy seguros pero no hacía falta ningún estudio para llegar a esa conclusión.

En general, la determinación del margen de error y del nivel de confianza “adecuados”, no es un tema de la Estadística, ni de los estadísticos, es una decisión del equipo de investigación, que tiene conocimiento de los riesgos reales de equivocarse y del presupuesto disponible.

p: La variabilidad en la población

Si en una población no hay variabilidad basta con mirar un solo elemento para saber cómo son todos. Cuando la variabilidad aumenta también lo hace el tamaño de muestra necesario para estimar sus características. Si se trata de estimar una proporción esa variabilidad está relacionada con el valor de la propia proporción \(p\), o más concretamente con \(p(1-p)\). Aquí aparece un problema porque si queremos estimar una proporción no podemos usar el valor de esa proporción –que no conocemos– para calcular el tamaño de muestra necesario. La solución es calcular el tamaño de la muestra poniéndonos en el caso más desfavorable que es cuando \(p = 50\%\). A \(1-p\) también se le denomina \(q\), por esta razón muchas veces se habla del supuesto de \(p=q=50 %\) en las fichas técnicas de las encuestas.

N: El tamaño de la población

Parece que esta es la variable cuya influencia está más justificada, pero no es así. Si la población es grande –y esto es lo más habitual– su tamaño prácticamente no influye. Usando la fórmula que hemos visto y con la ayuda de una hoja de cálculo se puede construir la siguiente tabla donde se aprecia la poca influencia del tamaño de la población.

Tamaños de muestra para la estimación de una proporción con un nivel de confianza del 95 %
Tamaño de
la población
Margen de error
±1 % ±2 % ±3 % ±4 % ±5 % ±10 %
50047641434127321881
1.00090670751737627888
1.5001.29892462442930691
2.0001.6561.09269746232392
2.5001.9841.22574948533493
3.0002.2871.33478850134194
3.5002.5661.42581851334794
4.0002.8251.50184352335194
4.5003.0651.56686353035595
5.0003.2891.62388053635795
6.0003.6941.71590754636295
7.0004.0501.78892755336595
8.0004.3651.84794255936795
9.0004.6471.89695556336996
10.0004.9001.93796556737096
15.0005.8562.07099757837596
20.0006.4892.1441.01458337796
25.0006.9392.1911.02458737996
50.0008.0572.2911.04559438296
100.0008.7632.3451.05659738396
500.0009.4232.3901.06560038497
1.000.0009.5132.3961.06660038497
1.500.0009.5432.3981.06760038597
2.000.0009.5582.3991.06760138597
50.000.0009.6022.4011.06860138597

Aunque no aparece en la fórmula, el presupuesto disponible (tiempo, dinero, recursos) es seguramente la variable más influyente, de manera que muy a menudo la muestra es tan grande como los recursos permiten. En este caso, dado el tamaño de muestra, y establecido un nivel de confianza, se puede calcular el margen de error obtenido.