5.1 Estadísticos descriptivos
Las técnicas de análisis descriptivo nos permiten realizar un primer acercamiento a los datos que deseamos analizar. Existen numerosas herramientas que nos ayudarán a realizar esta tarea. A continuación revisamos algunas de ellas.
Tablas de frecuencias
Unidimensionales
Las tablas de frecuencias son una herramienta básica que nos permite explorar nuestros datos para conocer las relaciones entre las variables.
Son tablas de datos que permiten contabilizar una o más variables categóricas.
Vamos a realizar una tabla de frecuencias.
- Primero, descargamos e instalamos el paquete que necesitamos:
- También cargamos la base de datos que nos interesa analizar, en este caso, la encuesta que completamos en clase:
encuesta1 <- read_excel("/Users/sofiajaime/Documents/rprojects/primer_proyecto/datos/encuesta1.xlsx")- Ahora diseñamos una tabla unidimensional, llamando a la función “table” y, entre paréntesis, colocamos el nombre de nuestra encuesta, separado por el símbolo $ y luego el nombre de la variable que deseamos analizar:
table(encuesta1$cancion) # Tabla de canciones favoritas de Rosalía
table(encuesta1$muerte) # Tabla de razones de muerte de Sócrates
table(encuesta1$frase) # Tabla de frases motivacionales
table(encuesta1$diafavo) # Tabla de días favoritos de la semanaObtendremos una tabla como la del siguiente ejemplo, que muestra los nombres de las categorías de las variables y en la segunda fila la cantidad de veces (frecuencia) que aparece cada una de ellas:
Gráfico 5.1: Tabla de frecuencias
- Para obtener el total de los contables usamos la función “summary”. Pero antes, aprendemos a guardar una tabla de frecuencias, obtenida de nuestra base de datos inicial (denominada aquí “encuesta1”):
Otra función interesante, que nos brinda la longitud de nuestra tabla es:
Para obtener el segundo ítem, por ejemplo:
O bien, para seleccionar un rango de valores entre uno y otro:
¡Podemos probar con otra variable!
La función de table() excluye los valores perdidos, por default, es decir, de por sí. Si deseamos incluirlos debemos indicarle a R que lo haga, así:
tabla_edad <- table(encuesta1$edad, exclude=NULL)
tabla_edad # Chequeamos que exista la tabla y que incluya los valores perdidos
Las TF permiten extraer las proporciones de los datos que corresponden a cada nivel. Con una tabla de frecuencias simple, podemos hacerlo dividiendo cada valor de la tabla por el total de las observaciones de la misma.
tabla_genero <- table(encuesta1$genero) #Creamos la tabla de género
tabla_genero / sum(tabla_genero) # Dividimos por el total de valoresUna alternativa para realizar esta división manual para obtener las proporciones, es a través de una función:
Bidimensionales
Hasta aquí, hemos visto estadísticos descriptivos, específicamente, tablas unidimensionales. Pero hay más, como las bidimensioneles, es decir, que tienen dos dimensiones:
edad_cena <- table(encuesta1$edad, encuesta1$cena) # Tabla de género y días de la semana favoritos
rownames(edad_cena) <- c("Cenaría con...") # Dándole un valor a las filas
edad_cenaEstas tablas equivalen a una matriz de datos, por lo que puedo utilizar las mismas funciones que aplico a las segundas:
rowSums(edad_cena) # obtener número de filas
colSums(edad_cena) # obtener número de columnas
edad_cena[1, 2] # Get value in row 1, column 2
prop.table(edad_cena)** Más dimensiones a nuestra tabla***
cena_genero_cancion <- table(encuesta1$cena,
encuesta1$genero,
encuesta1$cancion)
dimnames(cena_genero_cancion)Las dimensiones serán renombradas de la siguiente manera:
dimnames(cena_genero_cancion)[[1]] <- c("Marx", "Obama", "Solo")
dimnames(cena_genero_cancion)[[2]] <- c("H", "M", "todxs")Para chequear: