对角化在特征基底里只剩拉伸
矩阵通常会扭曲格子、旋转箭头,很难在脑中描绘。但取特征向量,也就是受变换后方向不变、只改变长度的那些特殊方向,把它们当作新的坐标轴;在那个坐标里矩阵忽然变简单。旋转和歪斜都消失,只剩一个对角矩阵 D,把两条轴各按其特征值拉伸。这就是对角化 A = P D P⁻¹,其中 P 把特征向量竖成列。一旦这样拆开,幂 Aⁿ 几乎不费力,而对称矩阵里那两条轴恰好垂直。这一个事实把 PageRank、SVD、PCA 串成了一条线。
把同一个变换 A 在两个视角间切换。标准视角里格子扭曲,一支不是特征向量的普通箭头不仅长度变、连方向都弯了,很难跟住。切到特征基视角,两个特征向量成为新的坐标轴。这时 A 表现为一个对角变换 D = diag(λ1, λ2),只把第一条轴拉伸 λ1 倍、第二条轴拉伸 λ2 倍,旋转为零。选对基底,看似复杂的矩阵就归结为两次拉伸,这正是对角化的起点。
分步看 A = P D P⁻¹ 如何作用于一个向量。P 是把特征向量 v1、v2 竖成列的矩阵。阶段0是出发向量。阶段1的 P⁻¹ 把这向量送进特征坐标,让你读成"沿 v1 几格 + 沿 v2 几格"。阶段2的 D 在那个特征坐标里把第一分量乘 λ1、第二分量乘 λ2,只有拉伸,是最简单的一步。阶段3的 P 把结果送回原来的坐标。用 P⁻¹ 进去、用 D 拉伸、用 P 出来,这三个动作正好等于一次 A。
对角化真正的好处是幂。Aⁿ = P Dⁿ P⁻¹,中间的 Dⁿ 只是把每个特征值各自 n 次方的对角矩阵,把矩阵乘 n 次的辛苦消掉了。用滑块把幂 k 调大。一个向量每次都沿各特征方向乘 λi,绝对值大的那个特征值逐渐压过来。于是 k 越大,向量越来越对齐到最大特征值的方向(主特征向量)。这就是幂迭代法,也是 PageRank 和重复过程随时间落到一个方向的原理。
当矩阵对称(b 位置等于 c 位置)时,会发生特别的事。拖动控制非对角项的滑块。A 离对称还远时,它两条特征向量轴歪成一个斜角。一旦把 A 变成对称,两个特征向量正好成 90 度,即垂直相交。这就是谱定理:对称矩阵永远有正交规范的特征向量,因而分解为 A = Q Λ Qᵀ,其中 Q 是正交矩阵(旋转),Λ 是特征值的对角矩阵。你可以直接用 Qᵀ 代替 P⁻¹。这个正交对角化正是 SVD 和 PCA 的几何心脏。
一个诚实的提醒:并非每个矩阵都能对角化。开关的一侧是有两个不同特征方向的健康矩阵,它的特征向量张满平面,所以可对角化。另一侧是错切(shear)矩阵 [[1,1],[0,1]]。它的特征值是重复的单个 1,可特征向量只指向横轴一个方向。你会看到两支箭头叠到同一条线上。这种缺乏独立特征向量的矩阵叫亏损(defective),没有足够的方向去搭新坐标轴,就无法对角化。对角化的条件是 n 个独立的特征向量。