Con una cuenta desbloqueas el cuestionario, el foro de dudas y el tutor con IA de esta lección, además del registro de progreso y el certificado verificable al terminar «Álgebra Lineal: la geometría detrás de las matrices».
El teorema espectral exigía simetría. La factorización LU exigía que la matriz fuese cuadrada. La diagonalización exigía suficientes autovectores. La descomposición en valores singulares no exige nada:
A=UΣVT
con A de tamaño m×ncualquiera, U de m×m ortogonal, V de n×n ortogonal y Σ diagonal con entradas no negativas ordenadas de mayor a menor:
σ1≥σ2≥⋯≥σr>0=σr+1=⋯
donde r es el rango. Cuadrada o rectangular, invertible o singular, simétrica o no: la SVD existe siempre.
La lectura geométrica
Como U y V son ortogonales —rotaciones o reflexiones— y Σ solo estira ejes, la factorización dice:
Toda transformación lineal es una rotación, seguida de un estiramiento por ejes, seguida de otra rotación.
Eso es exactamente lo que viste en la lección 4: el círculo unidad va siempre a parar a una elipse. Las columnas de V son las direcciones de entrada que siguen siendo perpendiculares después de la transformación; las de U, sus imágenes normalizadas; y los σi, las longitudes de los semiejes.
De dónde salen los valores singulares
La construcción reduce el problema al teorema espectral. La matriz ATA es simétrica y semidefinida positiva —porque xTATAx=∥Ax∥2≥0—, así que por la lección 11 tiene base ortonormal de autovectores y autovalores no negativos:
ATA=VΣ2VT,σi=λi,ui=σiAvi
Y se comprueba que los ui así construidos son ortonormales. La SVD conecta además los cuatro subespacios de la lección 8 de la forma más limpia posible:
Subespacio
Base ortonormal
Fil(A)
v1,…,vr
Nul(A)
vr+1,…,vn
Col(A)
u1,…,ur
Nul(AT)
ur+1,…,um
Una sola factorización entrega bases ortonormales de los cuatro. Nada más lo hace.
1 de 6
La suma de piezas de rango 1
Desarrollando el producto se obtiene la forma más útil de la SVD:
A=σ1u1v1T+σ2u2v2T+⋯+σrurvrT
Cada sumando uiviT es una matriz de rango 1: un patrón vertical multiplicado por uno horizontal. La matriz entera es la superposición de esos patrones, ordenados del más importante al más irrelevante por sus σi.
Truncar la suma en k términos da Ak, y aquí llega el teorema que justifica media ciencia de datos:
Teorema de Eckart-Young. De todas las matrices de rango k, la que más se parece a A —tanto en norma espectral como en norma de Frobenius— es Ak. Y el error cometido es exactamente ∥A−Ak∥2=σk+1.
Que un teorema dé a la vez la mejor respuesta posible y una fórmula cerrada para el error es algo raro en matemática aplicada. Por eso la SVD aparece en compresión, en reducción de dimensionalidad, en eliminación de ruido, en sistemas de recomendación y en regularización.
Ejemplo resuelto: cuánto ocupa una aproximación
Una imagen en escala de grises de 512×512 son 262144 números. Guardar su aproximación de rango k requiere los k vectores de U, los k de V y los k valores singulares:
k(m+n+1)=k(512+512+1)=1025k
Con k=50 son 51250 números: un factor de compresión de 5.1, y en imágenes reales suele bastar para que la diferencia sea difícil de ver. El criterio para elegir k no es la vista sino la energía acumulada:
∑iσi2∑i≤kσi2
Se elige el k que retiene, por ejemplo, el 99 %. En el laboratorio verás el efecto contrario con el ruido: como el ruido no tiene estructura, reparte su energía entre todos los valores singulares y aplana la curva. Por eso truncar la SVD es también un filtro: elimina buena parte del ruido y conserva la señal.
Una matriz 200×300 tiene valores singulares σ1=40, σ2=12, σ3=0.02 y el resto por debajo de 10−14. ¿Cuál es su rango numérico razonable?
PCA: la SVD aplicada a datos
Sea una tabla de m observaciones y n variables. El análisis de componentes principales consiste en:
Centrar los datos restando la media de cada columna. Este paso no es opcional: sin él, la primera componente apunta al centro de masas y no a la dirección de máxima variabilidad.
Calcular la SVD de la matriz centrada X=UΣVT.
Las columnas de V son las componentes principales: direcciones ortogonales de varianza decreciente. La varianza explicada por la componente i es σi2/(m−1).
Proyectar sobre las primeras k componentes reduce la dimensión conservando el máximo de varianza posible — por Eckart-Young, ninguna otra proyección lineal de rango k conserva más.
La matriz de covarianza es C=XTX/(m−1), simétrica y semidefinida positiva: es exactamente el objeto de la lección 11. PCA es el teorema espectral aplicado a la covarianza, calculado por SVD para no formar C explícitamente y no elevar al cuadrado la condición — el mismo argumento de la lección 9.
Pseudoinversa y el cierre del curso
La SVD resuelve también los dos casos que quedaron abiertos en la lección 8. Definiendo la pseudoinversaA+=VΣ+UT, donde Σ+ invierte los σi no nulos y deja en cero los demás:
Si el sistema no tiene solución, A+b da la solución de mínimos cuadrados.
Si tiene infinitas, A+b da la de norma mínima, la que vive en el espacio fila.
Si tiene solución única, A+=A−1.
Un solo objeto que cubre los tres casos. Y el número de condición de la lección 7 se lee directamente del espectro: κ(A)=σ1/σr.
Playground · python
Lo que este modelo deja fuera
Calcular la SVD diagonalizando ATA —como hacen el laboratorio y el código de arriba— es didáctico y perfectamente válido a tamaños pequeños, pero eleva al cuadrado el número de condición: valores singulares por debajo de εmaˊquinaσ1 se pierden. Las bibliotecas serias usan bidiagonalización de Golub-Kahan seguida de un QR implícito, que trabaja siempre sobre A. Para matrices enormes ni siquiera eso: se usan métodos aleatorizados que estiman los primeros k valores singulares sin tocar el resto.
Y una advertencia sobre PCA: es una técnica lineal. Si la estructura de los datos es una curva o una variedad enrollada, las componentes principales no la capturan. Tampoco es invariante a la escala de las variables: si una está en metros y otra en milímetros, la segunda dominará el espectro. Estandarizar antes de aplicar PCA no es un detalle, es parte del método.
Cierre del curso
Las doce lecciones han recorrido un solo hilo. Un vector es una lista con dos operaciones; combinándolos aparece el span y con él la dimensión; una matriz es la función que respeta esas operaciones; el determinante mide cuánto deforma; la eliminación resuelve y la factorización guarda; los cuatro subespacios explican existencia y unicidad; la ortogonalidad da la mejor respuesta cuando no hay respuesta exacta; los autovalores encuentran las direcciones que la transformación respeta; la simetría los hace reales y ortogonales; y la SVD extiende todo eso a cualquier matriz.
Lo que sigue depende de a dónde vayas: Señales y Sistemas usará bases ortogonales y autovalores en cada lección; Inteligencia Artificial, gradientes, formas cuadráticas y PCA; Elasticidad, tensores simétricos y sus direcciones principales; Mecánica Orbital, cambios de base y rotaciones. En los cuatro casos volverás a encontrarte esta lección con otro vocabulario.
Laboratorio: Laboratorio · SVD y aproximación de rango bajo