Σ矩阵的语言STRANG / FIELD NOTES
MIT 18.065/7
课程地图
LECTURE 07 47:14 原课

把主要结构留下来

Eckart–Young: The Closest Rank k Matrix to A

从最优低秩近似,到点云中的第一条主轴。

这节课的核心问题

上一讲把矩阵拆成正交的秩一分量。这一讲问:只保留其中少数分量,究竟丢掉了多少,为什么已经是最好?Strang 先建立范数与 Eckart–Young 定理,再用课堂里的 4×4 矩阵检验直觉,最后将低秩近似连接到中心化、协方差和 PCA。

读完后,你应该能
  • 区分谱范数、Frobenius 范数和核范数,计算截断 SVD 的三种误差。

  • 准确陈述最佳低秩近似定理,解释为什么对角例子可通过正交变换推广。

  • 重现课堂的对角矩阵与竞争矩阵 B,理解低秩约束的代价。

  • 从中心化和协方差解释 PCA,并区分普通回归残差与正交距离。

  • 区分主方向 u₁、奇异值 σ₁、主成分坐标及解释方差。

从完整分解走向重要信息

只保留最大的 k 个 SVD 分量,能否在所有低秩矩阵中得到最小误差?

上一讲给出了完整的分解。对秩为 rr 的实矩阵 ARm×nA\in\mathbb R^{m\times n},把非零奇异值按大小排列:

A=UΣVT=i=1rσiuiviT,σ1σr>0.A=U\Sigma V^{\mathsf T}=\sum_{i=1}^{r}\sigma_i u_i v_i^{\mathsf T},\qquad \sigma_1\geq\cdots\geq\sigma_r>0.

每一项都是一个秩一矩阵;uiu_i 彼此正交归一,viv_i 也彼此正交归一。这些分量不仅相加等于原矩阵,还按奇异值大小给出了一个自然的排列。

Strang 从一个数据问题出发:当原矩阵有成千上万个独立方向,而我们的存储和计算只容许保留其中 100100 个时,应当保留哪些?这里的目标是找到数据中的主要结构。他用“只把训练数据全部记下来”作动机,强调学习还需要提取可解释、可迁移的规律;这是一段教学动机,并不是对任意学习算法的严格判据。

截断 SVD 定义为

Ak=i=1kσiuiviT=UkΣkVkT,0k<r.A_k=\sum_{i=1}^{k}\sigma_i u_i v_i^{\mathsf T}=U_k\Sigma_kV_k^{\mathsf T},\qquad 0\leq k<r.

UkU_km×km\times kΣk\Sigma_kk×kk\times kVkV_kn×kn\times k。本讲的 Eckart–Young 定理说,在后面指定的范数下,对于任意 rank(B)k\operatorname{rank}(B)\leq k 的同型矩阵都有

AAkAB.\|A-A_k\|\leq\|A-B\|.

这比“在已给出的 rr 个分量里选最好的 kk 个”更强:竞争者 BB 可以拥有完全不同的列空间、行空间和元素。它仍然无法取得更小的误差。课堂板书写的是秩 kk;采用“秩至多 kk”是更方便的标准表述,当 k<rk<rAkA_k 自身恰好为秩 kkkrk\geq r 时直接取 Ak=AA_k=A,误差为零。

但双竖线还没有定义。“最好”必须先说清楚如何测量误差。这就是本讲先转向范数的原因。

核对与补充说明

字幕 00:22–03:57;13:48 视频帧核对了 SVD、截断式及 Eckart–Young 板书。 教材印刷第 71 页的截断分解与定理相互核对。

带走这几点
  • 截断 SVD 是对所有秩至多 k 的竞争矩阵求最优。

  • “最佳近似”必须与具体误差范数一起理解。

先理解向量的三种长度

同一个向量,可以按总量、欧氏长度或最大分量来衡量。

Strang 先提出矩阵的 22-范数等于最大奇异值,随后退一步:先弄懂向量长度,才能解释矩阵如何放大这种长度。

v=(v1,,vn)Tv=(v_1,\ldots,v_n)^{\mathsf T},三个常用向量范数为

v2=(ivi2)1/2,v1=ivi,v=maxivi.\|v\|_2=\left(\sum_i|v_i|^2\right)^{1/2},\qquad \|v\|_1=\sum_i|v_i|,\qquad \|v\|_\infty=\max_i|v_i|.

v2\|v\|_2 是由勾股定理得到的通常长度;v1\|v\|_1 累计各分量的绝对大小;v\|v\|_\infty 只记录绝对值最大的分量。绝对值不可省略:负分量不能与正分量抵消,否则就不能成为长度。字幕里口语化的“直接相加”和“最大的分量”,应按上述数学定义阅读。

补充小例子。v=(3,4)v=(3,-4),三种长度分别是 5,7,45,7,4。不同答案没有矛盾,它们回答不同的大小问题。在二维平面里,v2=1\|v\|_2=1 是圆,v1=1\|v\|_1=1 是菱形,v=1\|v\|_\infty=1 是正方形;优化问题采用不同长度,就可能在不同的地方取得最小值。

定义补全。 矩阵的谱范数由欧氏向量长度诱导:

A2=maxx2=1Ax2=σ1.\|A\|_2=\max_{\|x\|_2=1}\|Ax\|_2=\sigma_1.

因此 σ1\sigma_1 测量的是 AA 对单位向量能够产生的最大伸长,并不是“把矩阵每个元素平方相加”的答案;后者属于另一个范数。

核对与补充说明

三种向量范数与绝对值依据教材印刷第 88 页核对;谱范数依据印刷第 71 页。

带走这几点
  • 向量 1-范数和无穷范数都必须包含绝对值。

  • 矩阵 2-范数是最大伸长率 σ₁。

为什么 1-范数与稀疏性有关

用不同方式惩罚小分量,会改变优化解保留多少个非零分量。

这一段是对后续信号处理与优化内容的预告。Strang 强调,11-范数在现代问题中变得很重要,因为在适当的约束和目标下,它会鼓励稀疏解:许多分量恰好为零,只有少数分量保留下来。

他用 22-范数的平方作对照。一个很小的分量在平方后更小,因此平方和惩罚往往容许许多小分量共同承担任务;11-范数对小分量仍给予线性惩罚,因而可能选择少数活动分量。稀疏表示的好处是解释性:如果只有几个非零系数,就比较容易看出哪些成分真正参与了表示。

课堂提到 basis pursuit(基追踪),这是把稀疏表示写成优化问题的一条路线。一个典型形式是

minxx1subject to Mx=b.\min_x\|x\|_1\quad\text{subject to }Mx=b.

这里的具体优化式是帮助复习的标准补充,课堂这一段没有推导算法。尤其不要把口语描述记成“凡是使用 11-范数,解一定大多为零”:稀疏性取决于约束、目标、矩阵和数据;若约束已经强制所有坐标非零,就不可能凭一个范数把它们变成零。课堂此处的重点是建立 11-范数与稀疏建模之间的联系。

这个联系随后会在矩阵层面再次出现:对奇异值求和的核范数,扮演了与低秩结构相关的角色。

核对与补充说明

课堂作概念预告;教材印刷第 89 页以范数单位球与约束直线的接触作补充解释。

带走这几点
  • 稀疏指许多坐标为零,而不只是数值很小。

  • 1-范数鼓励稀疏的说法需要结合具体优化问题。

什么性质使“大小”成为范数

非负性、齐次性和三角不等式,为误差比较提供一致规则。

课堂抽出所有范数应当具备的共同性质。对向量 v,wv,w 和实数 cc

v0,v=0v=0,\|v\|\geq0,\quad \|v\|=0\Longleftrightarrow v=0,

cv=cv,v+wv+w.\|cv\|=|c|\,\|v\|,\qquad \|v+w\|\leq\|v\|+\|w\|.

第一条区分零向量与非零向量;第二条是绝对齐次性,乘以 π-\pi 时长度乘以 π\pi;第三条是三角不等式,沿两段路走的总长度不小于直达的长度。课堂说“范数是正的”时,完整条件还包含零向量的范数等于零。

同样的三条性质也用于同型矩阵组成的向量空间。比如谱范数的三角不等式就是

σ1(A+B)σ1(A)+σ1(B).\sigma_1(A+B)\leq\sigma_1(A)+\sigma_1(B).

这里左边是“先把两个矩阵相加,再求最大奇异值”,不能误读成“把两组奇异值逐个相加”。课堂没有展开证明。一个简短补充是:对于任意单位向量 xx,由向量三角不等式有 (A+B)x2Ax2+Bx2A2+B2\|(A+B)x\|_2\leq\|Ax\|_2+\|Bx\|_2\leq\|A\|_2+\|B\|_2,再对 xx 取最大值即可。

有了这些性质,AB\|A-B\| 才能作为矩阵间一致的距离来比较近似误差。

核对与补充说明

范数性质已与教材印刷第 88 页核对。

带走这几点
  • 齐次性中的缩放系数是 |c|。

  • σ₁(A+B) 一般不等于 σ₁(A)+σ₁(B)。

谱范数、Frobenius 范数与核范数

对奇异值取最大值、平方和开根号、求和,得到本讲的三种矩阵大小。

Strang 接着补上两种矩阵范数。Frobenius 范数把矩阵当作一个很长的向量,把所有元素平方相加再开方:

AF=(i=1mj=1naij2)1/2=(i=1rσi2)1/2.\|A\|_F=\left(\sum_{i=1}^{m}\sum_{j=1}^{n}|a_{ij}|^2\right)^{1/2}=\left(\sum_{i=1}^{r}\sigma_i^2\right)^{1/2}.

它适合衡量总体平方误差,例如对全部像素的误差作平方和。最后一个等号可由 AF2=tr(ATA)\|A\|_F^2=\operatorname{tr}(A^{\mathsf T}A) 得到,因为 ATAA^{\mathsf T}A 的非零特征值正是 σi2\sigma_i^2。这个等号是教材补全;课堂此段先用元素定义,并在稍后指出三种范数都只依赖奇异值。

核范数则直接相加所有奇异值:

A=i=1rσi.\|A\|_*=\sum_{i=1}^{r}\sigma_i.

把三者并排看,就能记住它们与奇异值向量 σ=(σ1,,σr)\sigma=(\sigma_1,\ldots,\sigma_r) 的关系:

矩阵范数 奇异值计算 侧重的大小
谱范数 A2\|A\|_2 maxiσi\max_i\sigma_i 最强方向的伸长
Frobenius 范数 AF\|A\|_F iσi2\sqrt{\sum_i\sigma_i^2} 所有方向的平方能量
核范数 A\|A\|_* iσi\sum_i\sigma_i 全部奇异值的总量

容易混淆的命名。 矩阵 22-范数对应的是奇异值向量的无穷范数;Frobenius 范数才对应奇异值向量的 22-范数。核范数也不是通常所称的“矩阵诱导 11-范数”;后者由向量 11-范数诱导,等于最大绝对列和,通常不会在正交变换下保持不变。

下面的实验专门把谱范数画出来:旋转单位输入向量 xx,寻找使 Ax2\|Ax\|_2 最大的方向,再把最大读数与 σ1\sigma_1 比较。切换到压成线段的预设,观察为什么某个方向的伸长可以为零,而最大伸长仍然非零。Frobenius 范数和核范数则按上表从全部奇异值计算。

核对与补充说明

三种矩阵范数与 Frobenius 范数的迹表达式已核对教材印刷第 71、73 页。

02

动手实验 · 补充可视化

寻找最大的伸长

转动一个单位向量,亲手找到矩阵的谱范数。

实验 02 / 寻找最大伸长

谱范数是哪个方向的长度?

观察任务 拖动圆上的橘色点,寻找 ‖Ax‖ 最大的方向。找到以后,再试试“压成线段”。

选一个单位向量 x拖动图中任意位置改变方向
x₁x₂011xAx
‖A‖₂ = max‖x‖=1 ‖Ax‖
A=2.000.520.901.08
当前 ‖Ax‖1.768改变输入方向继续观察
最大可能值 σ₁2.400最小值 σ₂ = 0.700

0.7 ≤ ‖Ax‖ ≤ 2.4

改变矩阵

θ = 25° 或 205° 时,x 沿 ±v₁,达到最大伸长 σ₁。沿 ±v₂ 时达到最小伸长 σ₂。

想一想:矩阵元素中绝对值最大的那个数,就是谱范数吗?

不是。谱范数考虑所有单位向量,并对输出的完整长度取最大值。它等于最大奇异值 σ₁,通常不等于某个矩阵元素。

补充实验 · 用可操作的例子复现数学关系
带走这几点
  • 谱范数只看最大奇异值,Frobenius 范数累计平方能量。

  • 核范数不是矩阵诱导 1-范数。

最佳近似与三种精确误差

保留同一个 Aₖ,对三种范数都最优;但三种误差数值不同。

现在可以把开头的定理说完整:对于谱范数、Frobenius 范数和核范数,截断 SVD 都给出一个最佳秩至多 kk 的近似。更一般的正交不变范数也有相应结论;不能把这个结果不加区分地套在任意自定义矩阵误差上。

为什么误差可以直接从奇异值读出来?因为

AAk=i=k+1rσiuiviTA-A_k=\sum_{i=k+1}^{r}\sigma_i u_i v_i^{\mathsf T}

本身已经是被舍弃部分的奇异值分解。因此三个最小误差分别为

minrank(B)kAB2=σk+1,\min_{\operatorname{rank}(B)\leq k}\|A-B\|_2=\sigma_{k+1},

minrank(B)kABF=i=k+1rσi2,minrank(B)kAB=i=k+1rσi.\min_{\operatorname{rank}(B)\leq k}\|A-B\|_F=\sqrt{\sum_{i=k+1}^{r}\sigma_i^2},\qquad \min_{\operatorname{rank}(B)\leq k}\|A-B\|_*=\sum_{i=k+1}^{r}\sigma_i.

课堂与补充的边界。 Strang 本讲选择解释定理的意义、例子和正交不变性,没有完成最优性的证明。他提到讲义里有谱范数和 Frobenius 范数的不同证明,并提及 Srebro 的证明。下面给出教材式的谱范数证明,作为可选的复习补充。

W=span{v1,,vk+1}W=\operatorname{span}\{v_1,\ldots,v_{k+1}\}。对任意秩至多 kk 的矩阵 BBdimN(B)nk\dim N(B)\geq n-k,所以 WWN(B)N(B) 必有非零交集。选择交集中的单位向量 z=i=1k+1civiz=\sum_{i=1}^{k+1}c_iv_i,于是 Bz=0Bz=0,并且

(AB)z22=Az22=i=1k+1σi2ci2σk+12i=1k+1ci2=σk+12.\|(A-B)z\|_2^2=\|Az\|_2^2=\sum_{i=1}^{k+1}\sigma_i^2c_i^2\geq\sigma_{k+1}^2\sum_{i=1}^{k+1}c_i^2=\sigma_{k+1}^2.

AB2σk+1\|A-B\|_2\geq\sigma_{k+1};而 AkA_k 已经达到这个下界。这一证明的结构是:秩预算不足,使竞争者必定漏掉前 k+1k+1 个方向中的某个方向。

“最佳”不自动意味着“唯一”。 在 Frobenius 范数下,若 0<k<r0<k<rσk>σk+1\sigma_k>\sigma_{k+1},最佳矩阵 AkA_k 唯一;若切分位置出现相等的正奇异值,可能有多个最佳矩阵。谱范数下,即便存在这个间隔也不保证唯一。例如 A=diag(4,3,2,1)A=\operatorname{diag}(4,3,2,1)k=2k=2 时,diag(4,3,0,0)\operatorname{diag}(4,3,0,0)diag(3,3,0,0)\operatorname{diag}(3,3,0,0) 的谱误差都为 22。课堂没有讨论唯一性,这里用于防止把定理读得过强。

核对与补充说明

误差公式与谱范数证明核对教材印刷第 71–75 页;唯一性辨析和反例为本页补充。

带走这几点
  • 谱误差是第一个舍弃奇异值,Frobenius 误差是全部舍弃奇异值的平方和开根号。

  • 定理保证一个最优解;唯一性必须另加条件并说明范数。

从缺失评分到矩阵补全

核范数把少量潜在因素的假设,转化为可以优化的矩阵模型。

课堂在核范数旁写下 Netflix 和 MRI,说明范数选择会影响真实问题的建模方式。

在电影推荐例子中,一行对应一位用户,一列对应一部电影,矩阵元素是评分。每个人只看过一部分电影,所以这个矩阵大而且有许多缺失项。任务是根据已知评分,预测某个用户可能如何评价尚未看过的电影。Strang 也提醒,人的评分习惯等因素同样会影响推荐,不能把整个问题只看成纯粹的矩阵运算。

低秩模型的直觉是:大量评分可能由较少的潜在偏好因素解释。核范数求和所有奇异值,可以作为低秩建模的一种凸替代。标准建模补充是,在观测位置集合 Ω\Omega 上保留已知值,并求

minXXsubject to Xij=Mij((i,j)Ω).\min_X\|X\|_*\quad\text{subject to }X_{ij}=M_{ij}\quad((i,j)\in\Omega).

这与本讲的截断 SVD 问题有联系,也有差别:截断 SVD 的输入矩阵 AA 全部已知,要求在秩预算内逼近它;矩阵补全的输入只有部分元素,要求同时利用观测约束和结构假设恢复未知部分。把缺失评分填成零后直接做 SVD,会把“没看过”错误地当作“评分为零”。核范数也不能保证在任意缺失模式下完全恢复;还需要足够且合适的观测等条件。

MRI 例子强调采样时间与信息量的折中:希望减少采样、缩短检查时间,就需要从不完整测量重建结构。课堂借它解释稀疏或低秩方法的用途,没有给出完整成像测量模型。这里保留这层方法联系,不将其简化为“任意 MRI 图像缺失像素都能由核范数补齐”。

Netflix 奖金和算法的叙述在课堂中用作历史动机;本讲可直接带走的数学内容,是“观测不完整 + 结构假设 + 合适的优化目标”这一建模链条。

带走这几点
  • 缺失项不等于数值零。

  • 低秩近似和矩阵补全的输入条件、约束不同。

课堂例子:4、3、2、1 中保留什么

对角矩阵让奇异值可直接看见,最佳秩二近似保留 4 与 3。

Strang 取了一个完全具体的例子:

A=[4000030000200001],k=2.A=\begin{bmatrix}4&0&0&0\\0&3&0&0\\0&0&2&0\\0&0&0&1\end{bmatrix},\qquad k=2.

这是正对角矩阵,特征值和奇异值在这里恰好都是 4,3,2,14,3,2,1,左右奇异向量可以取标准基。截断前两项得到

A2=diag(4,3,0,0),AA2=diag(0,0,2,1).A_2=\operatorname{diag}(4,3,0,0),\qquad A-A_2=\operatorname{diag}(0,0,2,1).

所以三种误差分别是

AA22=2,AA2F=5,AA2=3.\|A-A_2\|_2=2,\qquad\|A-A_2\|_F=\sqrt5,\qquad\|A-A_2\|_*=3.

这些误差数值是根据已核对的课堂矩阵补算的,课堂此时主要在问“你能找到更接近而仍为秩二的矩阵吗”。重点是允许竞争者使用任意矩阵,不要求它保持对角形式。

他还强调,固定秩的矩阵集合不是一个线性子空间:两个秩二矩阵相加,秩可能升到四。例如 diag(4,3,0,0)\operatorname{diag}(4,3,0,0)diag(0,0,2,1)\operatorname{diag}(0,0,2,1) 分别为秩二,它们的和就是秩四的 AA。因此不能像投影到某个固定线性子空间那样,直接把“所有秩二矩阵”当作一个平面。

上面的 4×44\times4 例子可直接按公式核对三种误差。下方二维补充实验把同一原理画成椭圆:保留 k=1k=1 时,第二条半轴被舍弃;逐渐降低第二个奇异值,观察秩一近似的误差怎样下降。它用两个方向说明低秩近似的几何意义,而课堂例子有四个方向。

核对与补充说明

21:03–21:49 字幕与 24:15 视频板书交叉核对;三个误差由矩阵直接计算。 另与教材印刷第 72 页的同一课堂矩阵核对。

03

动手实验 · 补充可视化

只留下最重要的方向

在同一坐标尺度上比较原矩阵与截断近似。

实验 03 / 舍去一个方向

低秩近似,究竟损失了什么?

观察任务 固定保留一项,把 σ₂ 从 0 慢慢增大。观察图形差异和两种误差怎样一起变化。

保留的奇异项数 k
原矩阵 A单位圆的像
x₁x₂011
近似 A₁相同坐标尺度
x₁x₂011
谱范数误差 ‖A − Aₖ‖₂0.90下一奇异值 σ2
Frobenius 误差0.90舍去奇异值的平方和开根号
保留的能量87.7%Σᵢ≤ₖ σᵢ² / Σᵢ σᵢ²
试试预设

秩至多为 1 的最佳近似是 A₁ = σ₁u₁v₁ᵀ。这个二维例子只舍去一项,所以两种误差恰好都等于 σ₂ = 0.90。

想一想:保留 90% 能量,是否表示任何输入的误差都只有 10%?

不是。能量按全部奇异值的平方和计算,是整体指标。沿被舍去的右奇异向量输入,近似矩阵的输出会直接变为零,而原输出可能不为零。

补充实验 · 用可操作的例子复现数学关系
带走这几点
  • 课堂 A₂=diag(4,3,0,0),三种误差为 2、√5、3。

  • 秩约束集合一般不是线性子空间。

为什么“每个对角元素更接近”仍然会输

课堂构造一个非对角竞争者,显示低秩条件必须付出的代价。

只看对角线上被舍弃的 2211,似乎还能改进。Strang 尝试把前两个对角元素都改为 3.53.5,后两个都改为 1.51.5。但四个非零对角元素会产生秩四,所以他把矩阵改造成两个秩一块:

B=[3.53.5003.53.500001.51.5001.51.5].B=\begin{bmatrix}3.5&3.5&0&0\\3.5&3.5&0&0\\0&0&1.5&1.5\\0&0&1.5&1.5\end{bmatrix}.

每个 2×22\times2 常数块的两行相同,因此各为秩一,整个 BB 为秩二。它的四个对角元素确实都只错了 0.50.5;若只盯着对角线,就会觉得它比舍弃 2211 更划算。

问题在于,为了保持秩低,它在原本为零的非对角位置加入了 3.53.51.51.5。完整误差矩阵是

AB=[0.53.5003.50.500000.51.5001.50.5].A-B=\begin{bmatrix}0.5&-3.5&0&0\\-3.5&-0.5&0&0\\0&0&0.5&-1.5\\0&0&-1.5&-0.5\end{bmatrix}.

把课堂的比较算完。 Frobenius 误差的平方为

ABF2=4(0.5)2+2(3.5)2+2(1.5)2=30,\|A-B\|_F^2=4(0.5)^2+2(3.5)^2+2(1.5)^2=30,

显著大于截断解的 55。两个对称块的特征值分别为 ±12.5\pm\sqrt{12.5}±2.5\pm\sqrt{2.5},故谱误差为 12.53.536>2\sqrt{12.5}\approx3.536>2,核范数误差为 212.5+22.510.233>32\sqrt{12.5}+2\sqrt{2.5}\approx10.233>3。这些是讲义补算,课堂用非对角元素造成的代价作直观说明。

这一个竞争者失败,当然不能代替对所有 BB 的定理证明;它解释的是为什么那个定理并非仅凭“挑最大的两个数”就显然成立。误差应当考察整个矩阵,而不能只挑看起来变好的几个元素。

应用补充:图像实验。 灰度图可以写成像素矩阵,截断 SVD 提供一个最优 Frobenius 低秩重建。下方图像实验是本页的教学补充,不是这段课上的原例子。调节保留的秩,观察被舍弃方向怎样影响整幅图像;注意数学上的平方误差最小并不等同于任何视觉感知指标都最优。

核对与补充说明

22:48–24:37 字幕与 24:15 视频帧确认 B 的两个常数块;误差数值为本页补算。 另与教材印刷第 72 页的两个常数块 B 核对。

04

动手实验 · 补充可视化

让一张课堂画面慢慢清晰

用真实课堂画面,观察秩、细节和重建误差。

实验 04 / 从矩阵到图像

保留多少个奇异值,板书才读得清?

观察任务 先只保留 1 项,再逐渐增加 k。比较大块明暗和粉笔细节分别在什么时候出现。

正在载入本地课堂图像的 SVD 数据…

补充实验 · 用可操作的例子复现数学关系
带走这几点
  • 秩约束会耦合矩阵元素,不能逐个元素独立优化。

  • 比较完整误差矩阵,才能识别非对角项付出的代价。

对角矩阵并不局限于一个特殊例子

换一组正交坐标,奇异值和本讲三种范数都不变。

接着 Strang 回应一个自然的质疑:刚才的 AA 是对角矩阵,会不会过于特殊?把它视为 Σ=diag(4,3,2,1)\Sigma=\operatorname{diag}(4,3,2,1),再在两边乘上任意正交矩阵:

A=UΣVT.A=U\Sigma V^{\mathsf T}.

这个新矩阵通常已不再对角,但它的奇异值仍是 4,3,2,14,3,2,1。原因不是计算巧合,而是我们写出的形式本身已经满足 SVD 的条件:正交矩阵、非负降序对角矩阵、正交矩阵的转置。

因而凡是只依赖奇异值的范数,在左、右正交变换下都保持不变:

QAR=A当 QTQ=I, RTR=I,\|QAR\|=\|A\|\quad\text{当 }Q^{\mathsf T}Q=I,\ R^{\mathsf T}R=I,

这里 QQm×mm\times mRRn×nn\times n,范数限定为本讲的谱范数、Frobenius 范数、核范数等正交不变范数。“正交不变”并不是所有矩阵范数共有的属性。

把最优化问题一起换坐标。 由于正交矩阵可逆,BBUTBVU^{\mathsf T}BV 的秩相同,而且

AB=UT(AB)V=ΣUTBV.\|A-B\|=\|U^{\mathsf T}(A-B)V\|=\|\Sigma-U^{\mathsf T}BV\|.

随着 BB 遍历全部秩至多 kk 的矩阵,UTBVU^{\mathsf T}BV 也遍历同一类秩约束矩阵。因此在奇异向量坐标系里研究对角的 Σ\Sigma,不会漏掉竞争者。课堂的对角例子实际上代表了一整族具有相同奇异值的矩阵。

核对与补充说明

正交不变性及对角例子的推广核对教材印刷第 71–72 页。

带走这几点
  • 正交变换改变坐标和奇异向量,不改变奇异值。

  • 必须同时变换目标 A 和竞争矩阵 B。

把不变性亲手算出来

QᵀQ=I 同时解释向量保长和正交矩阵乘积仍正交。

Strang 回到最熟悉的向量欧氏长度。如果 QQ 是正交矩阵,则

Qv22=(Qv)T(Qv)=vTQTQv=vTv=v22.\|Qv\|_2^2=(Qv)^{\mathsf T}(Qv)=v^{\mathsf T}Q^{\mathsf T}Qv=v^{\mathsf T}v=\|v\|_2^2.

几何上可以想成转动或反射整个图形,长度没有改变。这个结论专指欧氏长度:例如把 (1,0)(1,0) 旋转 4545^\circ,欧氏长度仍为 11,但向量 11-范数变成 2\sqrt2。因此上一段关于范数的限定是实质条件。

矩阵情形也无需重新求全部奇异值。若 A=UΣVTA=U\Sigma V^{\mathsf T},则

QA=(QU)ΣVT.QA=(QU)\Sigma V^{\mathsf T}.

其中 QUQU 仍正交,因为

(QU)T(QU)=UTQTQU=UTU=I.(QU)^{\mathsf T}(QU)=U^{\mathsf T}Q^{\mathsf T}QU=U^{\mathsf T}U=I.

所以这已经是 QAQA 的一组 SVD:只改了左奇异向量,Σ\Sigma 和右奇异向量保持原样。右乘正交矩阵的论证类似。它解释了为什么谱范数、Frobenius 范数和核范数不变,而不只是把“不变”当成一条记忆公式。

这一段也结束了课堂对 Eckart–Young 定理的讨论。Strang 明确说,本讲给的是含义和例子,没有完成定理证明。随后转向应用这些结构理解真实数据:主成分分析。

核对与补充说明

正交不变性核对教材;QᵀQ=I 的逐步运算为课堂论证整理。

带走这几点
  • 正交矩阵可包含反射,不只是旋转。

  • QA 的 SVD 可直接写成 (QU)ΣVᵀ。

PCA 的第一步:让数据以均值为中心

每一列是一名样本;每一行减去自身的均值。

课堂从平面中的点云开始:每个人测量两个量,第一行是身高,第二行是年龄。记原始数据矩阵为

A0=[h1h2hNa1a2aN]R2×N.A_0=\begin{bmatrix}h_1&h_2&\cdots&h_N\\a_1&a_2&\cdots&a_N\end{bmatrix}\in\mathbb R^{2\times N}.

列是样本,行是特征。这个约定决定了后面该使用 AATAA^{\mathsf T} 还是 ATAA^{\mathsf T}A,所以先把维数写清楚。

PCA 在这里寻找身高和年龄的主要线性联系。首先计算各行均值 hˉ=N1jhj\bar h=N^{-1}\sum_j h_jaˉ=N1jaj\bar a=N^{-1}\sum_j a_j,并从每个样本减去同一个均值向量 μ=(hˉ,aˉ)T\mu=(\bar h,\bar a)^{\mathsf T}

A=A0μ1T=[h1hˉhNhˉa1aˉaNaˉ].A=A_0-\mu\mathbf1^{\mathsf T}=\begin{bmatrix}h_1-\bar h&\cdots&h_N-\bar h\\a_1-\bar a&\cdots&a_N-\bar a\end{bmatrix}.

现在 A1=0A\mathbf1=0,即每一行的和、每一行的均值都为零;点云的重心搬到了原点。原本的身高和年龄是正数,中心化后出现负数并不表示负身高或负年龄,而是表示低于样本平均值。

此时可以寻找一条经过原点、最能代表点云的直线。转换回原始坐标,它会经过 μ\mu,而不是强迫原始点云的最佳直线经过坐标原点。

实践补充。 中心化只减去均值,并没有消除计量单位的差异。把身高从米改成厘米,会改变欧氏距离各方向的权重,也可能改变 PCA 的主方向。是否还应按标准差缩放,是另外一个建模决定;不能把“中心化”和“标准化”混为一谈。

核对与补充说明

31:33–35:34 字幕;44:50 视频帧确认 A₀、逐行减均值与 each row now adds to 0 板书。 中心化及样本为列的约定另核对教材印刷第 75–76 页。

带走这几点
  • 本讲数据按“特征为行,样本为列”组织。

  • 中心化使每一行和为零,并让拟合子空间围绕样本均值。

同样叫最佳直线,最小化的距离却不同

普通直线回归度量竖直残差,PCA 度量点到直线的正交距离。

Strang 先限定 PCA 的能力:它寻找线性结构。他借此引出神经网络中的非线性作用;本讲没有继续展开深度学习模型。

面对“最佳直线”,容易立即想到普通最小二乘回归。设平面点为 (hj,aj)(h_j,a_j),回归 ach+da\approx ch+d 的目标是

minc,dj(ajchjd)2.\min_{c,d}\sum_j(a_j-ch_j-d)^2.

这里身高作为给定的横坐标,年龄作为需要预测的纵坐标;误差沿竖直方向度量。写成设计矩阵 DD 和观测向量 bb,普通线性最小二乘的正规方程为

DTDβ^=DTb.D^{\mathsf T}D\,\hat\beta=D^{\mathsf T}b.

我们用 DD 代替课堂此处的设计矩阵符号 AA,避免与 PCA 数据矩阵混淆。正规方程来自残差与 DD 的列空间正交;当 DD 满列秩时系数解唯一。课堂提醒这是 18.06 中很重要的应用,并将在本课程继续学习。

PCA 的直线拟合却同时对待两个坐标。对中心化的样本列 xjR2x_j\in\mathbb R^2,让 uu 为单位方向,投影点为 uuTxjuu^{\mathsf T}x_j,目标为

minu2=1jxjuuTxj22.\min_{\|u\|_2=1}\sum_j\|x_j-uu^{\mathsf T}x_j\|_2^2.

这里是垂直于拟合直线的几何距离,不是垂直于横轴的竖直距离。两个最优化问题的误差模型不同,因此通常会得到不同的线。称 PCA 为“不是最小二乘”容易造成另一层误会:它仍然最小化平方距离之和,只是不是这个固定自变量、仅沿响应方向测误差的普通回归问题。

补充推导。 由正交分解,xj22=uTxj2+xjuuTxj22\|x_j\|_2^2=|u^{\mathsf T}x_j|^2+\|x_j-uu^{\mathsf T}x_j\|_2^2。点云的总平方长度固定,因此最小化丢弃的平方长度,等价于最大化保留的投影平方长度:

maxu2=1juTxj2=maxu2=1uTAATu.\max_{\|u\|_2=1}\sum_j|u^{\mathsf T}x_j|^2=\max_{\|u\|_2=1}u^{\mathsf T}AA^{\mathsf T}u.

这已经把几何拟合问题接到了特征值与 SVD。下面的交互实验可同时显示回归线和 PCA 线:改变点云形状,比较两种残差方向,尤其观察接近竖直的点云。

核对与补充说明

两种距离与正交分解的补充推导已核对教材印刷第 77 页。

05

动手实验 · 补充可视化

两条“最好的”拟合直线

比较竖直残差与正交残差,理解 PCA 为什么不同。

PRINCIPAL COMPONENTS

同一组点,两种距离

观察任务 拖动一个数据点,或选择“接近竖直”。两条直线什么时候接近,什么时候分开?

PCA · 正交距离最小普通回归 · 竖直距离最小
-3-2-1123xy
主方向保留的方差91.0%λ₁ / (λ₁ + λ₂)
PCA 正交残差平方和2.930丢弃第二个方向的能量
回归竖直残差平方和3.981与左侧采用不同的距离定义
C=[2.4341.3561.3561.198]C=\begin{bmatrix}2.434&1.356\\1.356&1.198\end{bmatrix}先减去均值 (0.150, 0.370),再计算 AAᵀ / 9。

两条拟合直线都经过数据均值(十字标记)。PCA 同时考虑两个坐标方向的偏离;普通回归把 x 当作解释变量,最小化竖直偏差。

补充实验 · 每列一个样本,10 个样本;图中的 PCA 方向是左奇异向量 u₁。
带走这几点
  • 普通回归区分输入与响应;PCA 在所选欧氏尺度下对称地处理特征。

  • PCA 最小化正交平方残差,等价于最大化投影能量。

样本协方差把统计问题写成矩阵

对已中心化的 2×N 数据,协方差是 AAᵀ/(N−1)。

统计学看数据时,除了均值,还关心方差:每个特征怎样围绕平均值变化。对于身高和年龄两组数据,还需要协方差来描述两者是否一起增大或减小。

当样本是列、中心化数据矩阵为 AR2×NA\in\mathbb R^{2\times N} 时,样本协方差矩阵为

S=1N1AAT=[sh2shashasa2],N>1.S=\frac{1}{N-1}AA^{\mathsf T}=\begin{bmatrix}s_h^2&s_{ha}\\s_{ha}&s_a^2\end{bmatrix},\qquad N>1.

其中

sh2=j(hjhˉ)2N1,sa2=j(ajaˉ)2N1,sha=j(hjhˉ)(ajaˉ)N1.s_h^2=\frac{\sum_j(h_j-\bar h)^2}{N-1},\quad s_a^2=\frac{\sum_j(a_j-\bar a)^2}{N-1},\quad s_{ha}=\frac{\sum_j(h_j-\bar h)(a_j-\bar a)}{N-1}.

对角项是各特征的样本方差,非对角项是协方差。协方差为正表示两种偏离平均值的量倾向同号,为负则倾向异号;它依赖单位,并不是已经归一化到 [1,1][-1,1] 的相关系数。课堂的身高—年龄例子用于解释共同变化,实际关联仍取决于选取的样本人群。

“样本”或“经验”说明这里是从观察到的数据计算统计量,区别于从一个已知概率分布直接求理论协方差。Strang 用自由度解释 N1N-1:减去估计的均值后,每行中心化数据满足一个和为零的约束。统计条件补充: 在独立同分布、二阶矩存在的常见抽样条件下,除以 N1N-1 给出总体协方差的无偏估计;如果任务定义采用 1/N1/N,也可计算另一种经验二阶矩,但数值尺度不同。

从 PCA 的方向问题看,把 AATAA^{\mathsf T} 乘以 1/(N1)1/(N-1) 不改变特征向量,只统一缩放特征值。这正是课堂说“N1N-1 不影响这里计算”的具体含义;它并不是说计算方差时分母可以随意忽略。

若软件把每个样本放在一行,数据矩阵会转置,相应公式变为 ATA/(N1)A^{\mathsf T}A/(N-1)。记忆公式前先确认维数:本讲要的是特征之间的 2×22\times2 协方差矩阵。

核对与补充说明

41:03–44:59 字幕;44:50 视频帧明确确认板书 AAᵀ/(N−1),修正字幕容易混淆的转置位置。 样本协方差公式另核对教材印刷第 76 页;无偏性的抽样条件为本页补充。

带走这几点
  • AAᵀ 的维数是特征数×特征数;转置约定改变时公式也随之改变。

  • N−1 的缩放影响方差数值,但不改变主方向。

最后的连接:主方向是 u₁,强度才是 σ₁

用一个方向描述点云,最后回到最佳秩一近似。

临近下课,Strang 想用一条直线总结身高和年龄的关系。他先说最佳比例是 σ1\sigma_1,随后在约 46:27 自己停下来纠正:要找的是指向正确方向的向量,应该是 u1u_1,并表示下次再正式完成推导。复习时应保留这个纠正,不能把前面的口误当成结论。

在本讲“样本为列”的约定下,A=UΣVTA=U\Sigma V^{\mathsf T} 给出

AATu1=σ12u1.AA^{\mathsf T}u_1=\sigma_1^2u_1.

因此第一主方向是左奇异向量 u1u_1,也是样本协方差矩阵最大特征值对应的单位特征向量。它决定直线朝哪里走;σ1\sigma_1 决定这个方向上保留多少平方能量,样本方差则为 σ12/(N1)\sigma_1^2/(N-1)

u1=(uh,ua)Tu_1=(u_h,u_a)^{\mathsf T}uh0u_h\neq0,在中心化坐标中直线斜率是 ua/uhu_a/u_h;在原始坐标中为 aaˉ=(ua/uh)(hhˉ)a-\bar a=(u_a/u_h)(h-\bar h)。若 uh=0u_h=0,最佳线竖直,应使用参数式 μ+tu1\mu+t u_1,不应强行求一个有限斜率。u1u_1u1-u_1 表示同一条线。

把本讲前后接起来的补充。 将全部样本投影到这条线上:

u1u1TA=σ1u1v1T=A1.u_1u_1^{\mathsf T}A=\sigma_1u_1v_1^{\mathsf T}=A_1.

所以 PCA 的最佳一维重建,正是中心化数据的最佳秩一近似。沿直线的样本坐标(scores)为 u1TA=σ1v1Tu_1^{\mathsf T}A=\sigma_1v_1^{\mathsf T};方向、坐标和强度是不同对象。推广到前 kk 个方向,重建为 UkUkTA=AkU_kU_k^{\mathsf T}A=A_k,总平方残差为 i>kσi2\sum_{i>k}\sigma_i^2,在 A0A\neq0 时保留的方差比例为

i=1kσi2i=1rσi2.\frac{\sum_{i=1}^{k}\sigma_i^2}{\sum_{i=1}^{r}\sigma_i^2}.

这部分补全了课堂留到以后展开的推导。若最大奇异值重复,第一条最佳主轴可以不唯一;若数据全相同,中心化后 A=0A=0,没有由变化决定的优先方向,方差比例的分母也为零。

现在回看整讲:SVD 给出正交方向和强度,范数衡量丢弃的信息,Eckart–Young 保证截断的最优性,中心化与协方差把它们连接到 PCA。

核对与补充说明

45:00–47:14 完整字幕核对,特别保留 46:27–46:54 的课堂自我纠正;正式 PCA 推导为教材与本页补充。 u₁ 主方向、总方差与 PCA 关系已核对教材印刷第 75–78 页;统一保留样本方差的 N−1 缩放。

带走这几点
  • 主方向是 u₁,斜率是其两个坐标的比值,不能把斜率写成 σ₁。

  • PCA 重建是中心化矩阵的截断 SVD,解释方差要用奇异值的平方。

CLOSE THE LOOP

合上讲义,还能讲清楚吗?

用几道问题,检查你是否掌握了这一讲的关键区别。

概念索引 · 中英术语对照
截断 SVD Truncated SVD

仅保留最大的 k 个奇异值及其配对奇异向量得到的矩阵 Aₖ。

最佳低秩近似 Best low-rank approximation

在指定范数下,寻找秩至多 k 的矩阵,使其与已知矩阵的距离最小。

谱范数 Spectral norm

由向量欧氏范数诱导的矩阵范数,等于最大奇异值。

Frobenius 范数 Frobenius norm

全部元素平方和的平方根,也等于全部奇异值平方和的平方根。

核范数 Nuclear norm

全部奇异值之和,常用于低秩结构的凸优化建模。

正交不变性 Orthogonal invariance

左、右乘适当维数的正交矩阵后,范数不改变。

稀疏 Sparse

向量有许多恰好为零的分量;矩阵有许多恰好为零的元素。

矩阵补全 Matrix completion

从部分已知矩阵元素与结构假设估计其余缺失元素。

中心化 Centering

每个样本减去样本均值向量,使每个特征的均值为零。

样本协方差 Sample covariance

从中心化样本计算特征间共同变化的矩阵;本讲约定为 AAᵀ/(N−1)。

第一主方向 First principal direction

使投影方差最大的单位方向;样本为列时为 A 的第一左奇异向量 u₁。

主成分坐标 Principal component scores

样本在主方向上的投影坐标;第一组为 u₁ᵀA=σ₁v₁ᵀ。

解释方差比例 Explained variance ratio

在总方差非零时,选定主方向的奇异值平方和占全部奇异值平方和的比例。

学习整理 · 原课:MIT OpenCourseWare / Gilbert Strang · 教材:Linear Algebra and Learning from Data