10.1 Variables categóricas

En esta clase responderemos a la pregunta: ¿Qué sucede cuándo deseamos incluir variables de tipo categóricas en nuestra regresión, como variables independientes?

Primero, las variables categóricas contienen un número finito de categorías, que son grupos dinstinguibles entre sí. Los datos categóricos no necesariamente deben tener un orden lógico. A diferencia de las variable discretas, que son variables numéricas que tienen un número contable de valores entre dos valores. Es decir, que una variable discreta siempre es numérica. Por ejemplo, el número de quejas de los clientes o el número de fallas o defectos en una compañía. También se distinguen de las variables continuas, que son aquellas variables numéricas que tienen un número infinito de valores entre dos valores cualesquiera. Una variable continua puede ser numérica o de fecha/hora. Por ejemplo, la longitud de una pieza o la fecha y hora en que se recibe un pago.

Segundo, debemos saber que existen diferentes tipos dentro del grupo de variables categóricas. Existen aquellas que son “dummies”, es decir, que como resultado pueden tener dos opciones o categorías (como el sexo, aunque podemos “criticar” esta dicotomía, se encuentra codificada de esta manera en la mayoría de las bases de datos). También las hay con más de dos “outcomes” o resultados, como puede ser la clase social: podemos pensar en un esquema de tres clases, “alta”, “media” y “baja”. Si bien en nuestra base de datos se encuentra codificada con números, por ejemplo 0=“clase alta”; 1=“clase media” y 2=“clase baja”, entendemos que estas representan categorías.

Ahora bien, ¿cómo podemos incluirlas en nuestras regresiones? Y, también muy importante, ¿cómo debemos interpretar los coeficientes de correlación que se presentan en nuestras tablas?

Regresión de una dummy

Gráfico 10.1: Regresión de una dummy