6.3 Boxplots
Un diagrama de cajas representa de forma gráfica la distribución de puntuaciones dentro de una variable. Es una forma de describir las puntuaciones que contiene una variable y su distribución de forma visual.
Gráfico 6.1: Boxplot 1
Con este diagrama se representan varios estadísticos descriptivos de las puntuaciones que contiene la variable. Estos descriptivos son:
Mediana: Es la línea negra más gruesa que está dentro de la caja azul. La mediana de una variable es su valor central, después de haber ordenado todos sus valores de menor a mayor (no olvidéis nunca este paso que es el que siempre se os olvida al hacer los exámenes!!!!). Separa la mitad superior de los datos de la mitad inferior. Si una variable tiene las siguientes observaciones: 1, 3, 3, 4, 5, 7, 7, 7, 9; la mediana de esta variable es 5 (fíjate en que los valores de la variable ya están ordenados de menor a mayor!).
En el diagrama de arriba, podemos ver que la mediana de la variable es 5.
Cuartiles: El 1º Cuartil (Q1) y el 3º Cuartil (Q3) delimitan los límites inferior (Q1) y superior (Q3) de la caja. Recordemos que los cuartiles dividen la muestra en 4 partes iguales: 1º Cuartil: valor hasta el primer 25% de la muestra, 2º cuartil: valor hasta el 50% de la muestra; 3º Cuartil: valor hasta el 75% de la muestra.
Como en el diagrama se muestran el valor que delimita desde el primer 25% de la muestra (Q1, límite inferior de la caja) hasta el 75% de la muestra (Q3, límite superior de la caja), la caja completa delimita las puntuaciones centrales de la variable. Es decir, la caja representa el 50 % central de las puntuaciones de una variable, sin el 25% más pequeño y el 25% más alto.
En el diagrama de arriba, el valor de Q1 es 3, y el valor de Q3 es 6. Esto quiere decir que el 50% central de la variable oscila entre las puntuaciones 3 y 6.
Vale, recapitulemos un poquito aquí. La caja ya la tenemos clara, la línea horizontal gruesa que está dentro de la caja es la mediana de la variable. Los límites de la caja son el Q1 y el Q3, y por lo tanto mirando la caja podemos saber que los valores que delimitan al 50% de puntuaciones centrales de la variable son el 3 y el 6:
Gráfico 6.2: Boxplot 2
Las rayas verticales sirven para ver entre qué puntuaciones se mueve la variable. Dicho de otro modo, sirve para identificar el valor máximo y el valor mínimo de la variable, y lo que es más útil, para identificar casos con valores atípicos (o extremos). Antes de poder dibujar/interpretar las dos líneas verticales que le salen a la caja azul (a estas líneas se les llama bigotes), tenemos que tener claros una serie de conceptos:
Valores atípicos: Los valores atípicos son aquellos que muestran una gran distancia a la media del resto de puntuaciones en la variable (recuerdo, ver vídeo). Con el diagrama de cajas podemos identificar de una forma muy fácil aquellos participantes cuyas puntuaciones en la variable se alejan demasiado de la media, es decir, o son demasiado bajas o son demasiado altas.
Rango Intercuartil: Es la diferencia entre el Cuartil 1 y el Cuartil 3. En el diagrama que tenemos en las imágenes, la diferencia en las puntuaciones entre el Cuartil 1(valor 3) y el Cuartil 3 (valor 6) (Q3-Q1) es 3 (6-3). Por lo tanto, el rango intercuartil es 3.
Valores atípicos leves: Una puntuación es un valor atípico leve cuando se sitúa fuera del siguiente intervalo: Límite Inferior (f1) = Cuartil 1 - 1,5 x Rango Intercuartil Límite Superior (f3) = Cuartil 3 + 1,5 x Rango Intercuartil
Vamos a calcular este intervalo para los datos de nuestro ejemplo:
Límite Inferior (f1) = 3 - 1,5 x 3 = - 1,5 Límite Superior (f3) = 6 + 1,5 x 3 = 10,5
Vale, ya tenemos definidos todos los conceptos que nos van a ayudar a interpretar las líneas verticales. ¿Qué son estos valores que señalan las líneas verticales? Pues ahí va:
La línea vertical que está debajo de la caja representa la puntuación más pequeña de la variable, siempre que esta puntuación no sea más pequeña que el límite inferior que hemos calculado para identificar a los valores atípicos leves. Siguiendo nuestro ejemplo, es la puntuación más pequeña de la variable, siempre que esta puntuación no sea inferior a - 1,5. Como nuestra variable no tiene valores negativos, entonces el final de la línea vertical que está debajo de la caja es la puntuación más pequeña de la variable. Si volvemos a ver el diagrama identificaremos que el valor más pequeño de la variable es 1.
Vamos ahora con la línea vertical que está por encima de la caja.
La línea vertical que está por encima de la caja, es lo mismo que la línea de debajo, pero en este caso con las puntuaciones más altas de la variable. Por lo tanto, esta línea representa la puntuación más alta de la variable, siempre que esta puntuación no sea más alta que el límite superior que hemos calculado para identificar a los valores atípicos leves. Siguiendo nuestro ejemplo, es la puntuación más alta de la variable, siempre que esta puntuación no sea superior a 10,5. Si volvemos a ver el diagrama identificaremos que la línea vertical de encima de la caja llega hasta el valor 9. Entonces, el valor más alto de la variable, que está dentro del límite superior para valores extremos leves es 9.
Ya tenemos la caja, ya tenemos los bigotes, pero, falta algo, hay una bola en la parte superior del gráfico que tiene un 11. ¿Qué es esta bola? Y ¿Qué es este 11?
Casos extremos: En el gráfico de cajas y bigotes se verán todos los casos extremos de la variable como círculos o estrellas (las estrellas son casos más extremos que los representados por los círculos). Las puntuaciones extremas serán todas aquellas que estén por encima o por debajo del intervalo que hemos calculado para trazar las líneas verticales que salen de la caja.
La otra información que podemos sacar de un diagrama de cajas y bigotes es sobre la dispersión de las puntuaciones dentro de una variable. ¿A qué nos referimos con dispersión? pues a la distribución de las puntuaciones dentro de la variable, a si el rango de puntuaciones es muy grande, o si por el contrario todos los participantes han puntuado más o menos lo mismo. En la imagen de debajo podemos ver la diferencia entre una variable con una gran dispersión de puntuaciones (A) y una variable con una dispersión de puntuaciones muy pequeña (B).
Se pueden crear diagramas de caja para variables individuales o para variables por grupo. El formato es diagrama de caja (x, datos =), donde x es una fórmula y datos = denota el marco de datos que proporciona los datos. Un ejemplo de fórmula es y ~ grupo donde se genera una gráfica de caja separada para la variable numérica y para cada valor del grupo. Agregue varwidth = TRUE para hacer que los anchos de la gráfica de caja sean proporcionales a la raíz cuadrada de los tamaños de las muestras. Agregue horizontal = TRUE para invertir la orientación del eje.
Boxplot de MPG por Car Cylinders:
boxplot(mpg~cyl,data=mtcars, main="Car Milage Data",
xlab="Number of Cylinders", ylab="Miles Per Gallon")
Diagrama de caja con muescas de “crecimiento del diente” contra 2 factores cruzados. Agregamos cajas coloreadas para facilitar la interpretación:
boxplot(len~supp*dose, data=ToothGrowth, notch=TRUE,
col=(c("gold","darkgreen")),
main="Crecimiento diente", xlab="Suplemento y dosis")
En el diagrama de caja con muescas, si las muescas de dos cajas no se superponen, esto es una “evidencia sólida” para decir que sus medianas difieren.
Los colores se reciclan. En el ejemplo anterior, si hubiera enumerado 6 colores, cada cuadro tendría su propio color. Earl F. Glynn ha creado una lista de colores fácil de usar en formato PDF.