GIP.Grupo de Investigacion
Psicosocial
INFERENCIA ESTADISTICA MEDIANTE BOOTSTRAP

 
    Las técnicas de simulación agrupadas bajo el nombre genérico de bootstrap se ocupan de los mismos asuntos que la estadística paramétrica pero bajo otro enfoque. Como indican Efron y Tibshirani (1993) las ideas básicas de la estadística no han cambiado lo que ha cambiado es su implementación. La irrupción de los ordenadores ha aportado rapidez y flexibilidad en la aplicación de ciertas ideas hasta ahora aparcadas, permitiendo analizar aspectos no abordables con facilidad analíticamente (Diaconis y Efron, 1983).

    La idea básica del bootstrap es tratar la muestra como si fuera la población, y aplicar el muestreo Monte Carlo para generar una estimación empírica de la distribución muestral del estadístico.

    La verdadera estimación Monte Carlo requiere un conocimiento total de la población, pero por supuesto este no esta generalmente disponible en la investigación aplicada. Típicamente, tenemos sólo una muestra extraída de esa población, debido a lo cual es por lo que necesitamos, antes de nada, inferir  a partir de .

    En el bootstrapping, tratamos la muestra como si fuera la población y realizamos un procedimiento del estilo Monte Carlo sobre la muestra. Esto se hace extrayendo un gran número de "remuestras" de tamaño n de la muestra original aleatoriamente y con reposición. Así, aunque cada remuestra tendrá el mismo número de elementos que la muestra original, mediante el remuestreo con reposición cada remuestra podría tener algunos de los datos originales representados en ella más de una vez, y algunos que no aparecieran. Por lo tanto, cada una de estas remuestras probablemente será levemente y aleatoriamente diferente de la muestra original.  Y como los elementos en estas remuestras varían levemente , un estadístico *, calculado a partir de una de esas remuestras probablemente tomará un valor ligeramente diferente de los otros * y del  original . La afirmación fundamental del bootstrapping es que una distribución de frecuencias relativas de esos * calculada a partir de las remuestras es una estimación de la distribución muestral de  (Mooney y Duval, 1993).

    Más formalmente, los pasos básicos en la estimación bootstrap son los siguientes Efron, 1979; Hinckley, 1988; Efron y Tibshirani, 1993):
         1.- Construir una distribución de probabilidad empírica, , a partir de la muestra asignando una probabilidad de 1/n a cada punto, x1, x2, ..., xn. Esta es la función de distribución empírica (FDE) de x, la cual es el estimador no-paramétrico de máxima verosimilitud de la función de distribución de la población, F(X).
        2.- A partir de la FDE, , se extrae una muestra aleatoria simple de tamaño n con reposición. Esta es una "remuestra", x*b.
        3.- Se calcula el estadístico de interés, , a partir de esa remuestra, dando *b.
        4.- Se repiten los pasos 2 y 3 B veces, donde B es un número grande. La magnitud de B en la práctica depende de las pruebas que se van a aplicar a los datos. En general, B debería ser de entre 50 a 200 para estimar el error típico de , y al menos de 1000 para estimar intervalos de confianza alrededor de  (Efron y Tibshirani, 1986, 1993).
        5.- Construir una distribución de probabilidad a partir de los B *b asignando una probabilidad de 1/B a cada punto, *1*2, ..., *B. Esta distribución es la estimación bootstrap de la distribución muestral de  . Esta distribución puede usarse para hacer inferencias sobre .

    El estimador bootstrap del parámetro  se define como:
 
 

 
 

es decir, como la media de los valores del estadístico calculados en las B remuestras bootstrap.

    En algunas ocasiones se tiene algún conocimiento más que el estrictamente aportado por la muestra, por ejemplo se conoce la función de distribución de la variable objeto de estudio pero se desconocen los parámetros, que deben ser estimados. En estos casos se estimarían los parámetros a partir de la muestra y el remuestreo se realizaría a partir de la función teórica conocida, con los parámetros estimados, en lugar de a partir de la FDE construida a partir de la muestra. En este caso hablamos de Bootstrap Paramétrico.

    Para ejemplificar la aplicación de un procedimiento bootstrap vamos a hacer uso de los datos ofrecidos por Efron (1982, pág. 10) sobre la correlación entre las puntuaciones medias de 15 universidades, de una población de 82, en una Prueba de Acceso a la Universidad (PAU) y las puntuaciones de la prueba de admisión en las Facultades de Derecho (TFD). La correlación encontrada en esa muestra fue de 0'776. La correlación en la población toma un valor de 0'76.  En el desarrollo de los ejemplos se ha utilizado el programa Resampling Stats (Versión 4, para Windows'95) (Resampling Stats, Inc., 1998).
 
 
 

    Al operar este procedimiento obtenemos los siguientes resultados que el estimador bootstrap de la correlación (r-media en el programa) vale 0'779 (Es obvio que este valor variará levemente cada vez que ejecutemos el programa, pues las remuestras generadas no coincidirán) . En la siguiente gráfica podemos ver la estimación bootstrap de la distribución muestral de la correlación.

 
 
 
 
 
    Además si consultamos el fichero "numerosaleatorios" podremos comprobar los números empleados para seleccionar que elementos de la muestra original entran a formar parte de cada una de las remuestras. Cada secuencia de 15 números se corresponde con una remuestra. En la gráfica se ofrece el inicio de la serie de números aleatorios generados. Como puede verse en la primera secuencia de 15 números algunos se repiten como el 3 (2), el 2 (2), el 6 (2), el 5 (2), el 4 (3) y otros no aparecen como el 1, 7, 9, 10, 14 ó 15.