seegongsik
Mis palabras
Matemáticas para ingeniería

Una forma cuadrática es un cuenco moldeado por los valores propios

xᵀAx es un cuenco cuyos ejes son vectores propios y cuya curvatura son los valores propios; sus signos deciden mínimo, máximo o silla

Una recta era de primer orden. Ahora sube un peldaño y mira una altura que se curva sobre el plano. Es q(x) = xᵀAx, y al desplegar la matriz simétrica A = [a, b; b, c] queda q = a·x² + 2b·xy + c·y². Corta esta superficie a una altura constante (un conjunto de nivel) y obtienes una elipse o una hipérbola. Lo asombroso: la forma la fijan por entero los valores y vectores propios de A. Los vectores propios apuntan por los ejes principales del cuenco, y los valores propios fijan qué tan empinado se curva cada eje. Cuando ambos valores propios son positivos es un cuenco con un único fondo; cuando sus signos discrepan es una silla. Y las segundas derivadas (la hessiana) de cualquier función suave forman justamente una forma cuadrática, así que esta sola idea enhebra el criterio de la segunda derivada, el PCA y la optimización convexa en una sola línea.

Usa los controles para fijar las tres entradas a, b, c de la matriz simétrica A. La vista dibuja la altura q = a·x² + 2b·xy + c·y² como curvas de nivel. Cuando ambos valores propios son positivos las curvas son elipses cerradas, así que ves un cuenco que se hunde hacia el centro (tinte azul). Cuando ambos son negativos son las mismas elipses pero el centro es lo más alto, un domo (tinte rojo). Cuando uno es positivo y otro negativo las curvas se abren en una hipérbola, y obtienes una silla que sube por un lado y baja por el otro. Sube b y las curvas se inclinan en ángulo. La misma q sigue siendo una sola fórmula, y sin embargo cambiar solo a, b, c la mueve entre cuenco, domo y silla.

Ahora mira solo una curva: el conjunto de nivel cortado en q = 1, es decir xᵀAx = 1. Mantén A cerca de definida positiva y esta curva es una elipse limpia. Pero no yace al azar; sus dos ejes van exactamente a lo largo de los vectores propios de A. Y cada semieje mide 1/√λ. Un valor propio grande se curva empinado por ahí, así que la elipse es corta en esa dirección; un valor propio pequeño es suave, así que la elipse es larga. Mueve los controles para cambiar A y los vectores propios (ejes principales) y los valores propios se actualizan juntos. Esta elipse es justamente la elipse de covarianza del PCA, y pariente de sangre de la elipse que viste en la SVD; la única diferencia es que allí el semieje es √λ y aquí es 1/√λ.

Ahora empuja tú mismo los dos valores propios a través de cero. Mueve los controles λ1 y λ2 y el widget emite un veredicto al instante. Ambos positivos: definida positiva, un cuenco que se curva hacia arriba en todas direcciones, así que el centro es el mínimo único. Ambos negativos: definida negativa, un domo al revés, así que el centro es un máximo. Signos opuestos: indefinida, una silla. Uno exactamente cero: semidefinida, un canal que se curva en una dirección y queda plano en la otra. El positivo aparece en verde, el negativo en rojo, y un pequeño glifo de forma te dice si es cuenco, domo, silla o canal. La idea es que los dos signos lo deciden todo.

Mira por qué el término cruzado b·xy es una molestia, y cómo desaparece. Mantén fijos los dos valores propios λ1, λ2 y gira solo el ángulo θ; eso construye A = R Λ Rᵀ. Cuando θ no es cero el término cruzado b está vivo y la elipse yace inclinada. Usa el control para rotar la elipse. En el instante en que los ejes principales se alinean exactamente con los ejes x e y, b cae a 0, y en esas coordenadas q se resuelve limpiamente en q = λ1·y1² + λ2·y2², una forma sin término cruzado. Eso es la diagonalización. En A = Q Λ Qᵀ, rotar las coordenadas con Q elimina la mezcla y deja una suma pura donde los dos ejes actúan por separado. Abajo se muestra la expresión actual de q para estas coordenadas.

Por último, mira por qué todo esto es el corazón de la optimización. Cualquier función suave, cerca de un punto, se curva según una matriz simétrica llamada hessiana que reúne sus segundas derivadas. La hessiana es una forma cuadrática. Así que en un punto crítico donde el gradiente es cero: una hessiana definida positiva lo hace un mínimo local (el fondo de un cuenco), una definida negativa un máximo local (la cima de un domo), y una indefinida un punto de silla. Eso es el criterio de la segunda derivada. Mueve los controles para cambiar la hessiana y el paisaje de curvas y el veredicto cambian juntos. Por esto justamente el descenso de gradiente rueda a gusto hacia cuencos definidos positivos y se queda vagando en los puntos de silla. Que la curvatura en un punto sea positiva, negativa o mixta decide la respuesta.

En la prácticaUna forma cuadrática q(x) = xᵀAx usa una matriz simétrica A para crear una altura curvada sobre el plano. Es q = a·x² + 2b·xy + c·y², y el conjunto de nivel q = const es una elipse o una hipérbola. Los vectores propios de A son los ejes principales de esa curva y los valores propios fijan la curvatura. Los semiejes del conjunto de nivel xᵀAx = 1 miden 1/√λ. Ambos valores propios positivos es definida positiva (un cuenco, mínimo único), ambos negativos es definida negativa (un domo, máximo), signos opuestos es indefinida (una silla), y uno cero es semidefinida (un canal). Diagonalizar A = Q Λ Qᵀ rota las coordenadas para que el término cruzado desaparezca y q = λ1·y1² + λ2·y2². Para cualquier función suave la hessiana es una forma cuadrática, así que su definitud es el criterio de la segunda derivada y la razón de que el descenso de gradiente se asiente en cuencos. La covarianza del PCA, la SVD y la optimización convexa salen todas de este único cuenco.
Matemáticas para ingeniería
¿Te fue útil? Apoyar seegongsik