Con una cuenta desbloqueas el cuestionario, el foro de dudas y el tutor con IA de esta lección, además del registro de progreso y el certificado verificable al terminar «Álgebra Lineal: la geometría detrás de las matrices».
Cuando el sistema no tiene solución (y eso está bien)
En cualquier problema con datos medidos hay más ecuaciones que incógnitas: 200 observaciones, 3 parámetros. El sistema Ac=b exige que b caiga exactamente en Col(A), un subespacio de dimensión 3 dentro de R200. Con ruido de medida, eso no ocurre nunca.
La reacción correcta no es rendirse ni «forzar» el sistema, sino cambiar la pregunta:
en vez de Ac=b,minc∥b−Ac∥2
Geométricamente: buscar el punto de Col(A)más cercano a b. Y ya sabemos, desde la lección 3, cómo se encuentra el punto más cercano de un subespacio: proyectando.
Proyección sobre un subespacio
La lección 3 proyectaba sobre una recta imponiendo que el residuo fuera perpendicular a un vector. Ahora el subespacio tiene dimensión n y hay que imponer que el residuo sea perpendicular a todas las columnas a la vez. Eso es exactamente ATe=0:
AT(b−Ac^)=0⟺ATAc^=ATb
Estas son las ecuaciones normales. Obsérvese lo que ha pasado: un sistema de 200 ecuaciones incompatible se ha convertido en uno de 3 ecuaciones con 3 incógnitas y solución única. Proyectar reduce el problema a la dimensión del modelo.
Si las columnas de A son independientes, ATA es invertible —se demuestra viendo que ATAx=0 implica ∥Ax∥2=0, luego Ax=0, luego x=0— y entonces
c^=(ATA)−1ATb,p=PA(ATA)−1ATb
La matriz P es la generalización directa de la de la lección 3, y cumple lo mismo: PT=P y P2=P.
1 de 6
Por qué el mínimo es único y por qué no hay que buscarlo
La función que se minimiza es
f(c)=∥b−Ac∥2=cT(ATA)c−2bTAc+bTb
una forma cuadrática (lección 11) con matriz ATA definida positiva cuando las columnas son independientes. Su gráfica es un cuenco convexo: no hay mínimos locales, ni mesetas, ni sillas. Por eso las curvas de nivel del laboratorio son elipses concéntricas alrededor de un único punto, y por eso el ajuste lineal es tan estable comparado con casi cualquier ajuste no lineal: aquí no hay que buscar, hay que resolver.
La forma de esas elipses no es un detalle estético. Cuanto más alargadas, peor condicionado está el problema y más sensible es la solución al ruido — el número de condición de la lección 7, ahora visible.
Bases ortonormales: por qué se persiguen
Si las columnas de A fueran ortonormales —llamémoslas Q—, entonces QTQ=I y todo se simplifica de golpe:
c^=QTb,P=QQT
Sin inversas, sin sistemas: cada coordenada es un producto punto, y cambiar una no afecta a las demás. Ese desacoplamiento es lo que hace útiles a las bases ortonormales en todas partes: los senos y cosenos de Fourier en Señales y Sistemas, las componentes principales en la lección 12, las bases de wavelets en compresión de imagen.
Gram-Schmidt: fabricar una base ortonormal
Dada una base cualquiera {a1,…,an}, el procedimiento construye una ortonormal restando a cada vector sus proyecciones sobre los anteriores —es decir, quitándole todo lo que ya estaba representado:
vk=ak−∑i<k(qiTak)qi,qk=∥vk∥vk
Si en algún paso vk=0, ese ak era combinación de los anteriores: el procedimiento detecta la dependencia lineal sin buscarla.
Guardando los coeficientes usados se obtiene, gratis, la factorización QR:
A=QR,R=QTA triangular superior
Y con ella los mínimos cuadrados se resuelven sin formar nunca ATA:
ATAc^=ATb⟹RTQTQRc^=RTQTb⟹Rc^=QTb
un sistema triangular, resoluble por sustitución hacia atrás. Esto importa mucho más de lo que parece: formar ATA eleva al cuadrado el número de condición, κ(ATA)=κ(A)2. Un problema con κ(A)=108 —perfectamente resoluble por QR— se vuelve irresoluble en doble precisión si se pasa por las ecuaciones normales. Por eso las bibliotecas serias resuelven mínimos cuadrados con QR o con SVD, nunca con las ecuaciones normales.
Ejemplo resuelto: ajustar una recta a mano
Ajustemos y=c0+c1x a los puntos (1,2), (2,3) y (3,5). La matriz de diseño y el término independiente son
A=111123,b=235
Las ecuaciones normales:
ATA=[36614],ATb=[1023]
Resolviendo: 3c0+6c1=10 y 6c0+14c1=23. Restando el doble de la primera a la segunda: 2c1=3, luego c1=1.5 y c0=(10−9)/3=0.3333. La recta ajustada es y=0.3333+1.5x.
Los valores predichos son 1.8333, 3.3333 y 4.8333, y los residuos 0.1667, −0.3333, 0.1667. Dos comprobaciones que siempre deben cumplirse: los residuos suman cero (porque la primera columna de A es de unos, y el residuo es ortogonal a ella) y su producto punto con la columna x también es cero: 0.1667(1)−0.3333(2)+0.1667(3)=0.
Un problema de mínimos cuadrados tiene κ(A)≈108. ¿Qué método conviene usar?
Lo que mínimos cuadrados promete y lo que no
Minimizar la suma de cuadrados tiene una justificación estadística sólida —es el estimador de máxima verosimilitud si el ruido es gaussiano e independiente— y una debilidad conocida: castiga los errores grandes de forma cuadrática, así que un solo dato atípico puede arrastrar toda la recta. Compruébalo en el laboratorio activando el outlier.
Dos avisos más, que valen para cualquier ajuste:
Añadir parámetros siempre baja el RSS. Pasar de recta a cúbica mejora el ajuste por construcción, aunque el modelo esté empezando a ajustar el ruido. Comparar modelos exige penalizar la complejidad, no mirar solo el error.
Lineal se refiere a los parámetros, no a la curva. Ajustar una parábola c0+c1x+c2x2 es un problema lineal: las incógnitas entran linealmente aunque x aparezca al cuadrado. Ajustar c0ec1x no lo es.
Playground · python
Lo que este modelo deja fuera
El Gram-Schmidt clásico que hemos escrito es el correcto en aritmética exacta y inestable en coma flotante: los vectores dejan de ser ortogonales según avanza. Las implementaciones reales usan la variante modificada o, mejor, reflexiones de Householder. Y si las columnas de A son dependientes, ATA no es invertible y no hay solución única; la elección canónica —la de norma mínima— exige la pseudoinversa de la lección 12. En el laboratorio, los datos vienen de un generador de semilla fija con un modelo cuadrático conocido, de modo que puedes comparar los coeficientes ajustados con los verdaderos.
Hasta aquí hemos estudiado qué hace una matriz a los subespacios. En la lección 10 preguntamos otra cosa: ¿hay direcciones que la matriz respete, que solo estire sin girar?
Laboratorio: Laboratorio · Mínimos cuadrados como proyección