10.3 Regresión múltiple
Es raro que una variable dependiente se explique por una sola variable. En este caso, podemos incluir más de una variable independiente en lo que se denomina regresión múltiple. Las regresiones múltiples pueden ser lineales y no lineales.
Las regresiones múltiples se basan en el supuesto de que existe una relación lineal entre las variables dependientes e independientes. Tampoco asume una correlación importante entre las variables independientes.
10.3.1 Ejemplo: regresión lineal múltiple
Para este ejemplo utilizaremos la función lm, que representa “linear model”, es decir, un modelo lineal.
Este capítulo describe cómo calcular la regresión con variables categóricas.
Las variables categóricas (también conocidas como variables factoriales o cualitativas) son variables que clasifican las observaciones en grupos. Tienen un número limitado de valores diferentes, llamados niveles o categorías. Por ejemplo, el género de los individuos es una variable categórica que puede tomar dos niveles: Masculino o Femenino.
El análisis de regresión requiere variables numéricas. Entonces, cuando un investigador desea incluir una variable categórica en un modelo de regresión, se requieren pasos adicionales para que los resultados sean interpretables.
En estos pasos, las variables categóricas se recodifican en un conjunto de variables binarias independientes. Esta recodificación se denomina “codificación ficticia” y conduce a la creación de una tabla denominada matriz de contraste. Esto se realiza automáticamente mediante un software estadístico, como R.
Aquí, aprenderá a crear e interpretar un modelo de regresión lineal con variables predictoras categóricas.
## # A tibble: 14 × 4
## Year licenses defects lengths
## <dbl> <dbl> <dbl> <dbl>
## 1 1924 1.35 8 6
## 2 1925 1.96 8 6
## 3 1926 2.27 9 6
## 4 1927 2.48 10 6
## 5 1928 2.73 11 6
## 6 1929 3.09 11 7
## 7 1930 3.65 12 7
## 8 1931 4.62 16 7
## 9 1932 5.50 18 7
## 10 1933 6.26 19 8
## 11 1934 7.01 20 8
## 12 1935 7.62 21 8
## 13 1936 8.13 22 8
## 14 1937 8.59 23 8
¿Hay correlación?
## Year licenses defects lengths
## Year 1.0000000 0.9862573 0.9815811 0.9434564
## licenses 0.9862573 1.0000000 0.9920525 0.9425656
## defects 0.9815811 0.9920525 1.0000000 0.9332053
## lengths 0.9434564 0.9425656 0.9332053 1.0000000
Aquí podemos ver, por ejemplo, que el número de licencias está altamente correlacionado con el Año (r = 0,9862573) al igual que el número de defectuosos (r = 0,9815811). Esto es muy común con los datos de series de tiempo. Cualquier dos variables que se muevan juntas en una serie de tiempo mostrarán correlación, pero puede que no haya una relación real entre ellas, aparte de que ambas cambiaron constantemente durante ese período de tiempo. Para agudizar el punto, Tufte agregó una tercera variable: el número de letras en el nombre de la persona que fue presidente de los Estados Unidos durante (la mayor parte de) ese año. Como sucedió, esa variable aumentó constantemente durante este período de tiempo (r = 0,9425656). Como resultado, podemos predecir el número de defectuosos utilizando licencias o períodos.
##
## Call:
## lm(formula = defects ~ licenses, data = radios)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.9024 -0.5181 -0.2144 0.4317 1.3014
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 4.5822 0.4233 10.82 1.51e-07 ***
## licenses 2.2042 0.0807 27.31 3.58e-12 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.7262 on 12 degrees of freedom
## Multiple R-squared: 0.9842, Adjusted R-squared: 0.9828
## F-statistic: 746 on 1 and 12 DF, p-value: 3.577e-12
Aquí lm1 es una variable en la que se almacenan los resultados del ajuste del modelo. La función lm (modelo lineal) se ajusta al modelo. Los argumentos son la variable dependiente seguida de “~`”seguida de una lista de variables independientes. El argumento adicional (opcional) data = radios le dice a R en qué conjunto de datos buscar para encontrar estas variables.
##
## Call:
## lm(formula = defects ~ lengths, data = radios)
##
## Residuals:
## Min 1Q Median 3Q Max
## -3.8571 -0.9571 0.1429 1.2179 3.1429
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -26.4429 4.6242 -5.718 9.63e-05 ***
## lengths 5.9000 0.6558 8.996 1.11e-06 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 2.074 on 12 degrees of freedom
## Multiple R-squared: 0.8709, Adjusted R-squared: 0.8601
## F-statistic: 80.93 on 1 and 12 DF, p-value: 1.109e-06
Vemos, por ejemplo, que el 87,09% de la variabilidad en el número de personas con discapacidad se “explica por” el número de letras del nombre del presidente. Debido a que esta “explicación” carece de credibilidad, algunos prefieren referirse a la variabilidad como “compartida” entre las dos variables. Durante este período, las dos variables mostraron prácticamente la misma tendencia. (Dejamos que el lector explore el impacto de que Harry S. Truman se convirtiera en presidente en 1949). Si todo esto parece un poco tonto, recuerde que la próxima vez que vea una alta correlación, podría ser igualmente tonto.
Sin embargo, para nuestros propósitos de hoy, continuaremos e ilustraremos el uso de dos variables independientes en un solo modelo.
##
## Call:
## lm(formula = defects ~ lengths + licenses, data = radios)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.9135 -0.5461 -0.2124 0.4299 1.2721
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 5.1601 3.9387 1.310 0.217
## lengths -0.1059 0.7174 -0.148 0.885
## licenses 2.2393 0.2521 8.882 2.38e-06 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.7577 on 11 degrees of freedom
## Multiple R-squared: 0.9842, Adjusted R-squared: 0.9813
## F-statistic: 342.6 on 2 and 11 DF, p-value: 1.238e-10
La prueba F (muestra F = 342,6, p = 1,238e-10 = 1,238X10-10 = 0,0000000001238) indica que el modelo en su conjunto refleja una asociación real entre la variable dependiente y las variables independientes como grupo. La prueba t para cada coeficiente indica que las licencias hacen una fuerte contribución al modelo (t = 8.882, p = 0.00000238) mientras que las longitudes no (t = -0.148, p = 0.885). Tenga en cuenta que cuando ajustamos un modelo con longitudes solo como variable independiente obtuvimos un resultado muy diferente (t = 8,996, p = 0,00000111). Esto se debe a la naturaleza condicional de los coeficientes en regresión múltiple. Las longitudes variables por sí mismas comparten gran parte de su variabilidad con los defectos, pero una vez que se incluyen las licencias, hay muy poca variabilidad compartida adicional. Este es un problema común cuando tenemos mucha variabilidad compartida entre las variables independientes, algo llamado “multicolinealidad”. Aquí tenemos r = 0,9425656 entre longitudes y licencias. Cuando tenemos multicolinealidad, es común que las variables individuales cambien de significancia y que sus coeficientes se alteren e incluso inviertan el signo de un modelo al siguiente, como sucedió aquí.
El análisis de regresión implica una serie de supuestos. Comprobarlos aquí es especialmente esclarecedor porque al hacerlo se muestra cómo detectar regresiones sin sentido que no lo son de manera tan obvia.
Primero, hablemos del diseño del estudio y la naturaleza de las variables. Esta no es una muestra aleatoria de años, son catorce años consecutivos. Los datos de series de tiempo como este rara vez constituyen una muestra aleatoria. También rara vez tenemos independencia de las observaciones para los datos de series de tiempo. En cambio, es probable que un período de tiempo dado dé resultados similares al período de tiempo anterior y al siguiente, al menos más similares que los resultados de períodos de tiempo distantes. Este problema se llama “autocorrelación”. Tampoco se trata de ningún tipo de experimento. No podemos controlar la cantidad de radios con licencia ni la cantidad de letras en el nombre del presidente.
También hay algunas comprobaciones estándar que podemos hacer de los datos una vez que se han recopilado. Los modelos sobre todo asumen que tenemos una varianza constante en los residuos. Esto se verifica graficando con la y predicha. Primero, extraiga estos de los resultados del modelo ajustado y almacénelos en variables.