把主要结构留下来
Eckart–Young: The Closest Rank k Matrix to A
从最优低秩近似,到点云中的第一条主轴。
这节课的核心问题
上一讲把矩阵拆成正交的秩一分量。这一讲问:只保留其中少数分量,究竟丢掉了多少,为什么已经是最好?Strang 先建立范数与 Eckart–Young 定理,再用课堂里的 4×4 矩阵检验直觉,最后将低秩近似连接到中心化、协方差和 PCA。
区分谱范数、Frobenius 范数和核范数,计算截断 SVD 的三种误差。
准确陈述最佳低秩近似定理,解释为什么对角例子可通过正交变换推广。
重现课堂的对角矩阵与竞争矩阵 B,理解低秩约束的代价。
从中心化和协方差解释 PCA,并区分普通回归残差与正交距离。
区分主方向 u₁、奇异值 σ₁、主成分坐标及解释方差。
从完整分解走向重要信息
只保留最大的 k 个 SVD 分量,能否在所有低秩矩阵中得到最小误差?
上一讲给出了完整的分解。对秩为 的实矩阵 ,把非零奇异值按大小排列:
每一项都是一个秩一矩阵; 彼此正交归一, 也彼此正交归一。这些分量不仅相加等于原矩阵,还按奇异值大小给出了一个自然的排列。
Strang 从一个数据问题出发:当原矩阵有成千上万个独立方向,而我们的存储和计算只容许保留其中 个时,应当保留哪些?这里的目标是找到数据中的主要结构。他用“只把训练数据全部记下来”作动机,强调学习还需要提取可解释、可迁移的规律;这是一段教学动机,并不是对任意学习算法的严格判据。
截断 SVD 定义为
为 , 为 , 为 。本讲的 Eckart–Young 定理说,在后面指定的范数下,对于任意 的同型矩阵都有
这比“在已给出的 个分量里选最好的 个”更强:竞争者 可以拥有完全不同的列空间、行空间和元素。它仍然无法取得更小的误差。课堂板书写的是秩 ;采用“秩至多 ”是更方便的标准表述,当 时 自身恰好为秩 ; 时直接取 ,误差为零。
但双竖线还没有定义。“最好”必须先说清楚如何测量误差。这就是本讲先转向范数的原因。
字幕 00:22–03:57;13:48 视频帧核对了 SVD、截断式及 Eckart–Young 板书。 教材印刷第 71 页的截断分解与定理相互核对。
截断 SVD 是对所有秩至多 k 的竞争矩阵求最优。
“最佳近似”必须与具体误差范数一起理解。
先理解向量的三种长度
同一个向量,可以按总量、欧氏长度或最大分量来衡量。
Strang 先提出矩阵的 -范数等于最大奇异值,随后退一步:先弄懂向量长度,才能解释矩阵如何放大这种长度。
对 ,三个常用向量范数为
是由勾股定理得到的通常长度; 累计各分量的绝对大小; 只记录绝对值最大的分量。绝对值不可省略:负分量不能与正分量抵消,否则就不能成为长度。字幕里口语化的“直接相加”和“最大的分量”,应按上述数学定义阅读。
补充小例子。 对 ,三种长度分别是 。不同答案没有矛盾,它们回答不同的大小问题。在二维平面里, 是圆, 是菱形, 是正方形;优化问题采用不同长度,就可能在不同的地方取得最小值。
定义补全。 矩阵的谱范数由欧氏向量长度诱导:
因此 测量的是 对单位向量能够产生的最大伸长,并不是“把矩阵每个元素平方相加”的答案;后者属于另一个范数。
三种向量范数与绝对值依据教材印刷第 88 页核对;谱范数依据印刷第 71 页。
向量 1-范数和无穷范数都必须包含绝对值。
矩阵 2-范数是最大伸长率 σ₁。
为什么 1-范数与稀疏性有关
用不同方式惩罚小分量,会改变优化解保留多少个非零分量。
这一段是对后续信号处理与优化内容的预告。Strang 强调,-范数在现代问题中变得很重要,因为在适当的约束和目标下,它会鼓励稀疏解:许多分量恰好为零,只有少数分量保留下来。
他用 -范数的平方作对照。一个很小的分量在平方后更小,因此平方和惩罚往往容许许多小分量共同承担任务;-范数对小分量仍给予线性惩罚,因而可能选择少数活动分量。稀疏表示的好处是解释性:如果只有几个非零系数,就比较容易看出哪些成分真正参与了表示。
课堂提到 basis pursuit(基追踪),这是把稀疏表示写成优化问题的一条路线。一个典型形式是
这里的具体优化式是帮助复习的标准补充,课堂这一段没有推导算法。尤其不要把口语描述记成“凡是使用 -范数,解一定大多为零”:稀疏性取决于约束、目标、矩阵和数据;若约束已经强制所有坐标非零,就不可能凭一个范数把它们变成零。课堂此处的重点是建立 -范数与稀疏建模之间的联系。
这个联系随后会在矩阵层面再次出现:对奇异值求和的核范数,扮演了与低秩结构相关的角色。
课堂作概念预告;教材印刷第 89 页以范数单位球与约束直线的接触作补充解释。
稀疏指许多坐标为零,而不只是数值很小。
1-范数鼓励稀疏的说法需要结合具体优化问题。
什么性质使“大小”成为范数
非负性、齐次性和三角不等式,为误差比较提供一致规则。
课堂抽出所有范数应当具备的共同性质。对向量 和实数 :
第一条区分零向量与非零向量;第二条是绝对齐次性,乘以 时长度乘以 ;第三条是三角不等式,沿两段路走的总长度不小于直达的长度。课堂说“范数是正的”时,完整条件还包含零向量的范数等于零。
同样的三条性质也用于同型矩阵组成的向量空间。比如谱范数的三角不等式就是
这里左边是“先把两个矩阵相加,再求最大奇异值”,不能误读成“把两组奇异值逐个相加”。课堂没有展开证明。一个简短补充是:对于任意单位向量 ,由向量三角不等式有 ,再对 取最大值即可。
有了这些性质, 才能作为矩阵间一致的距离来比较近似误差。
范数性质已与教材印刷第 88 页核对。
齐次性中的缩放系数是 |c|。
σ₁(A+B) 一般不等于 σ₁(A)+σ₁(B)。
谱范数、Frobenius 范数与核范数
对奇异值取最大值、平方和开根号、求和,得到本讲的三种矩阵大小。
Strang 接着补上两种矩阵范数。Frobenius 范数把矩阵当作一个很长的向量,把所有元素平方相加再开方:
它适合衡量总体平方误差,例如对全部像素的误差作平方和。最后一个等号可由 得到,因为 的非零特征值正是 。这个等号是教材补全;课堂此段先用元素定义,并在稍后指出三种范数都只依赖奇异值。
核范数则直接相加所有奇异值:
把三者并排看,就能记住它们与奇异值向量 的关系:
| 矩阵范数 | 奇异值计算 | 侧重的大小 |
|---|---|---|
| 谱范数 | 最强方向的伸长 | |
| Frobenius 范数 | 所有方向的平方能量 | |
| 核范数 | 全部奇异值的总量 |
容易混淆的命名。 矩阵 -范数对应的是奇异值向量的无穷范数;Frobenius 范数才对应奇异值向量的 -范数。核范数也不是通常所称的“矩阵诱导 -范数”;后者由向量 -范数诱导,等于最大绝对列和,通常不会在正交变换下保持不变。
下面的实验专门把谱范数画出来:旋转单位输入向量 ,寻找使 最大的方向,再把最大读数与 比较。切换到压成线段的预设,观察为什么某个方向的伸长可以为零,而最大伸长仍然非零。Frobenius 范数和核范数则按上表从全部奇异值计算。
三种矩阵范数与 Frobenius 范数的迹表达式已核对教材印刷第 71、73 页。
动手实验 · 补充可视化
寻找最大的伸长
转动一个单位向量,亲手找到矩阵的谱范数。
谱范数是哪个方向的长度?
观察任务 拖动圆上的橘色点,寻找 ‖Ax‖ 最大的方向。找到以后,再试试“压成线段”。
0.7 ≤ ‖Ax‖ ≤ 2.4
θ = 25° 或 205° 时,x 沿 ±v₁,达到最大伸长 σ₁。沿 ±v₂ 时达到最小伸长 σ₂。
想一想:矩阵元素中绝对值最大的那个数,就是谱范数吗?
不是。谱范数考虑所有单位向量,并对输出的完整长度取最大值。它等于最大奇异值 σ₁,通常不等于某个矩阵元素。
谱范数只看最大奇异值,Frobenius 范数累计平方能量。
核范数不是矩阵诱导 1-范数。
最佳近似与三种精确误差
保留同一个 Aₖ,对三种范数都最优;但三种误差数值不同。
现在可以把开头的定理说完整:对于谱范数、Frobenius 范数和核范数,截断 SVD 都给出一个最佳秩至多 的近似。更一般的正交不变范数也有相应结论;不能把这个结果不加区分地套在任意自定义矩阵误差上。
为什么误差可以直接从奇异值读出来?因为
本身已经是被舍弃部分的奇异值分解。因此三个最小误差分别为
课堂与补充的边界。 Strang 本讲选择解释定理的意义、例子和正交不变性,没有完成最优性的证明。他提到讲义里有谱范数和 Frobenius 范数的不同证明,并提及 Srebro 的证明。下面给出教材式的谱范数证明,作为可选的复习补充。
令 。对任意秩至多 的矩阵 ,,所以 与 必有非零交集。选择交集中的单位向量 ,于是 ,并且
故 ;而 已经达到这个下界。这一证明的结构是:秩预算不足,使竞争者必定漏掉前 个方向中的某个方向。
“最佳”不自动意味着“唯一”。 在 Frobenius 范数下,若 且 ,最佳矩阵 唯一;若切分位置出现相等的正奇异值,可能有多个最佳矩阵。谱范数下,即便存在这个间隔也不保证唯一。例如 、 时, 和 的谱误差都为 。课堂没有讨论唯一性,这里用于防止把定理读得过强。
误差公式与谱范数证明核对教材印刷第 71–75 页;唯一性辨析和反例为本页补充。
谱误差是第一个舍弃奇异值,Frobenius 误差是全部舍弃奇异值的平方和开根号。
定理保证一个最优解;唯一性必须另加条件并说明范数。
从缺失评分到矩阵补全
核范数把少量潜在因素的假设,转化为可以优化的矩阵模型。
课堂在核范数旁写下 Netflix 和 MRI,说明范数选择会影响真实问题的建模方式。
在电影推荐例子中,一行对应一位用户,一列对应一部电影,矩阵元素是评分。每个人只看过一部分电影,所以这个矩阵大而且有许多缺失项。任务是根据已知评分,预测某个用户可能如何评价尚未看过的电影。Strang 也提醒,人的评分习惯等因素同样会影响推荐,不能把整个问题只看成纯粹的矩阵运算。
低秩模型的直觉是:大量评分可能由较少的潜在偏好因素解释。核范数求和所有奇异值,可以作为低秩建模的一种凸替代。标准建模补充是,在观测位置集合 上保留已知值,并求
这与本讲的截断 SVD 问题有联系,也有差别:截断 SVD 的输入矩阵 全部已知,要求在秩预算内逼近它;矩阵补全的输入只有部分元素,要求同时利用观测约束和结构假设恢复未知部分。把缺失评分填成零后直接做 SVD,会把“没看过”错误地当作“评分为零”。核范数也不能保证在任意缺失模式下完全恢复;还需要足够且合适的观测等条件。
MRI 例子强调采样时间与信息量的折中:希望减少采样、缩短检查时间,就需要从不完整测量重建结构。课堂借它解释稀疏或低秩方法的用途,没有给出完整成像测量模型。这里保留这层方法联系,不将其简化为“任意 MRI 图像缺失像素都能由核范数补齐”。
Netflix 奖金和算法的叙述在课堂中用作历史动机;本讲可直接带走的数学内容,是“观测不完整 + 结构假设 + 合适的优化目标”这一建模链条。
缺失项不等于数值零。
低秩近似和矩阵补全的输入条件、约束不同。
课堂例子:4、3、2、1 中保留什么
对角矩阵让奇异值可直接看见,最佳秩二近似保留 4 与 3。
Strang 取了一个完全具体的例子:
这是正对角矩阵,特征值和奇异值在这里恰好都是 ,左右奇异向量可以取标准基。截断前两项得到
所以三种误差分别是
这些误差数值是根据已核对的课堂矩阵补算的,课堂此时主要在问“你能找到更接近而仍为秩二的矩阵吗”。重点是允许竞争者使用任意矩阵,不要求它保持对角形式。
他还强调,固定秩的矩阵集合不是一个线性子空间:两个秩二矩阵相加,秩可能升到四。例如 与 分别为秩二,它们的和就是秩四的 。因此不能像投影到某个固定线性子空间那样,直接把“所有秩二矩阵”当作一个平面。
上面的 例子可直接按公式核对三种误差。下方二维补充实验把同一原理画成椭圆:保留 时,第二条半轴被舍弃;逐渐降低第二个奇异值,观察秩一近似的误差怎样下降。它用两个方向说明低秩近似的几何意义,而课堂例子有四个方向。
21:03–21:49 字幕与 24:15 视频板书交叉核对;三个误差由矩阵直接计算。 另与教材印刷第 72 页的同一课堂矩阵核对。
动手实验 · 补充可视化
只留下最重要的方向
在同一坐标尺度上比较原矩阵与截断近似。
低秩近似,究竟损失了什么?
观察任务 固定保留一项,把 σ₂ 从 0 慢慢增大。观察图形差异和两种误差怎样一起变化。
秩至多为 1 的最佳近似是 A₁ = σ₁u₁v₁ᵀ。这个二维例子只舍去一项,所以两种误差恰好都等于 σ₂ = 0.90。
想一想:保留 90% 能量,是否表示任何输入的误差都只有 10%?
不是。能量按全部奇异值的平方和计算,是整体指标。沿被舍去的右奇异向量输入,近似矩阵的输出会直接变为零,而原输出可能不为零。
课堂 A₂=diag(4,3,0,0),三种误差为 2、√5、3。
秩约束集合一般不是线性子空间。
为什么“每个对角元素更接近”仍然会输
课堂构造一个非对角竞争者,显示低秩条件必须付出的代价。
只看对角线上被舍弃的 和 ,似乎还能改进。Strang 尝试把前两个对角元素都改为 ,后两个都改为 。但四个非零对角元素会产生秩四,所以他把矩阵改造成两个秩一块:
每个 常数块的两行相同,因此各为秩一,整个 为秩二。它的四个对角元素确实都只错了 ;若只盯着对角线,就会觉得它比舍弃 和 更划算。
问题在于,为了保持秩低,它在原本为零的非对角位置加入了 和 。完整误差矩阵是
把课堂的比较算完。 Frobenius 误差的平方为
显著大于截断解的 。两个对称块的特征值分别为 、,故谱误差为 ,核范数误差为 。这些是讲义补算,课堂用非对角元素造成的代价作直观说明。
这一个竞争者失败,当然不能代替对所有 的定理证明;它解释的是为什么那个定理并非仅凭“挑最大的两个数”就显然成立。误差应当考察整个矩阵,而不能只挑看起来变好的几个元素。
应用补充:图像实验。 灰度图可以写成像素矩阵,截断 SVD 提供一个最优 Frobenius 低秩重建。下方图像实验是本页的教学补充,不是这段课上的原例子。调节保留的秩,观察被舍弃方向怎样影响整幅图像;注意数学上的平方误差最小并不等同于任何视觉感知指标都最优。
22:48–24:37 字幕与 24:15 视频帧确认 B 的两个常数块;误差数值为本页补算。 另与教材印刷第 72 页的两个常数块 B 核对。
动手实验 · 补充可视化
让一张课堂画面慢慢清晰
用真实课堂画面,观察秩、细节和重建误差。
保留多少个奇异值,板书才读得清?
观察任务 先只保留 1 项,再逐渐增加 k。比较大块明暗和粉笔细节分别在什么时候出现。
正在载入本地课堂图像的 SVD 数据…
秩约束会耦合矩阵元素,不能逐个元素独立优化。
比较完整误差矩阵,才能识别非对角项付出的代价。
对角矩阵并不局限于一个特殊例子
换一组正交坐标,奇异值和本讲三种范数都不变。
接着 Strang 回应一个自然的质疑:刚才的 是对角矩阵,会不会过于特殊?把它视为 ,再在两边乘上任意正交矩阵:
这个新矩阵通常已不再对角,但它的奇异值仍是 。原因不是计算巧合,而是我们写出的形式本身已经满足 SVD 的条件:正交矩阵、非负降序对角矩阵、正交矩阵的转置。
因而凡是只依赖奇异值的范数,在左、右正交变换下都保持不变:
这里 为 、 为 ,范数限定为本讲的谱范数、Frobenius 范数、核范数等正交不变范数。“正交不变”并不是所有矩阵范数共有的属性。
把最优化问题一起换坐标。 由于正交矩阵可逆, 与 的秩相同,而且
随着 遍历全部秩至多 的矩阵, 也遍历同一类秩约束矩阵。因此在奇异向量坐标系里研究对角的 ,不会漏掉竞争者。课堂的对角例子实际上代表了一整族具有相同奇异值的矩阵。
正交不变性及对角例子的推广核对教材印刷第 71–72 页。
正交变换改变坐标和奇异向量,不改变奇异值。
必须同时变换目标 A 和竞争矩阵 B。
把不变性亲手算出来
QᵀQ=I 同时解释向量保长和正交矩阵乘积仍正交。
Strang 回到最熟悉的向量欧氏长度。如果 是正交矩阵,则
几何上可以想成转动或反射整个图形,长度没有改变。这个结论专指欧氏长度:例如把 旋转 ,欧氏长度仍为 ,但向量 -范数变成 。因此上一段关于范数的限定是实质条件。
矩阵情形也无需重新求全部奇异值。若 ,则
其中 仍正交,因为
所以这已经是 的一组 SVD:只改了左奇异向量, 和右奇异向量保持原样。右乘正交矩阵的论证类似。它解释了为什么谱范数、Frobenius 范数和核范数不变,而不只是把“不变”当成一条记忆公式。
这一段也结束了课堂对 Eckart–Young 定理的讨论。Strang 明确说,本讲给的是含义和例子,没有完成定理证明。随后转向应用这些结构理解真实数据:主成分分析。
正交不变性核对教材;QᵀQ=I 的逐步运算为课堂论证整理。
正交矩阵可包含反射,不只是旋转。
QA 的 SVD 可直接写成 (QU)ΣVᵀ。
PCA 的第一步:让数据以均值为中心
每一列是一名样本;每一行减去自身的均值。
课堂从平面中的点云开始:每个人测量两个量,第一行是身高,第二行是年龄。记原始数据矩阵为
列是样本,行是特征。这个约定决定了后面该使用 还是 ,所以先把维数写清楚。
PCA 在这里寻找身高和年龄的主要线性联系。首先计算各行均值 、,并从每个样本减去同一个均值向量 :
现在 ,即每一行的和、每一行的均值都为零;点云的重心搬到了原点。原本的身高和年龄是正数,中心化后出现负数并不表示负身高或负年龄,而是表示低于样本平均值。
此时可以寻找一条经过原点、最能代表点云的直线。转换回原始坐标,它会经过 ,而不是强迫原始点云的最佳直线经过坐标原点。
实践补充。 中心化只减去均值,并没有消除计量单位的差异。把身高从米改成厘米,会改变欧氏距离各方向的权重,也可能改变 PCA 的主方向。是否还应按标准差缩放,是另外一个建模决定;不能把“中心化”和“标准化”混为一谈。
31:33–35:34 字幕;44:50 视频帧确认 A₀、逐行减均值与 each row now adds to 0 板书。 中心化及样本为列的约定另核对教材印刷第 75–76 页。
本讲数据按“特征为行,样本为列”组织。
中心化使每一行和为零,并让拟合子空间围绕样本均值。
同样叫最佳直线,最小化的距离却不同
普通直线回归度量竖直残差,PCA 度量点到直线的正交距离。
Strang 先限定 PCA 的能力:它寻找线性结构。他借此引出神经网络中的非线性作用;本讲没有继续展开深度学习模型。
面对“最佳直线”,容易立即想到普通最小二乘回归。设平面点为 ,回归 的目标是
这里身高作为给定的横坐标,年龄作为需要预测的纵坐标;误差沿竖直方向度量。写成设计矩阵 和观测向量 ,普通线性最小二乘的正规方程为
我们用 代替课堂此处的设计矩阵符号 ,避免与 PCA 数据矩阵混淆。正规方程来自残差与 的列空间正交;当 满列秩时系数解唯一。课堂提醒这是 18.06 中很重要的应用,并将在本课程继续学习。
PCA 的直线拟合却同时对待两个坐标。对中心化的样本列 ,让 为单位方向,投影点为 ,目标为
这里是垂直于拟合直线的几何距离,不是垂直于横轴的竖直距离。两个最优化问题的误差模型不同,因此通常会得到不同的线。称 PCA 为“不是最小二乘”容易造成另一层误会:它仍然最小化平方距离之和,只是不是这个固定自变量、仅沿响应方向测误差的普通回归问题。
补充推导。 由正交分解,。点云的总平方长度固定,因此最小化丢弃的平方长度,等价于最大化保留的投影平方长度:
这已经把几何拟合问题接到了特征值与 SVD。下面的交互实验可同时显示回归线和 PCA 线:改变点云形状,比较两种残差方向,尤其观察接近竖直的点云。
两种距离与正交分解的补充推导已核对教材印刷第 77 页。
动手实验 · 补充可视化
两条“最好的”拟合直线
比较竖直残差与正交残差,理解 PCA 为什么不同。
同一组点,两种距离
观察任务 拖动一个数据点,或选择“接近竖直”。两条直线什么时候接近,什么时候分开?
两条拟合直线都经过数据均值(十字标记)。PCA 同时考虑两个坐标方向的偏离;普通回归把 x 当作解释变量,最小化竖直偏差。
普通回归区分输入与响应;PCA 在所选欧氏尺度下对称地处理特征。
PCA 最小化正交平方残差,等价于最大化投影能量。
样本协方差把统计问题写成矩阵
对已中心化的 2×N 数据,协方差是 AAᵀ/(N−1)。
统计学看数据时,除了均值,还关心方差:每个特征怎样围绕平均值变化。对于身高和年龄两组数据,还需要协方差来描述两者是否一起增大或减小。
当样本是列、中心化数据矩阵为 时,样本协方差矩阵为
其中
对角项是各特征的样本方差,非对角项是协方差。协方差为正表示两种偏离平均值的量倾向同号,为负则倾向异号;它依赖单位,并不是已经归一化到 的相关系数。课堂的身高—年龄例子用于解释共同变化,实际关联仍取决于选取的样本人群。
“样本”或“经验”说明这里是从观察到的数据计算统计量,区别于从一个已知概率分布直接求理论协方差。Strang 用自由度解释 :减去估计的均值后,每行中心化数据满足一个和为零的约束。统计条件补充: 在独立同分布、二阶矩存在的常见抽样条件下,除以 给出总体协方差的无偏估计;如果任务定义采用 ,也可计算另一种经验二阶矩,但数值尺度不同。
从 PCA 的方向问题看,把 乘以 不改变特征向量,只统一缩放特征值。这正是课堂说“ 不影响这里计算”的具体含义;它并不是说计算方差时分母可以随意忽略。
若软件把每个样本放在一行,数据矩阵会转置,相应公式变为 。记忆公式前先确认维数:本讲要的是特征之间的 协方差矩阵。
41:03–44:59 字幕;44:50 视频帧明确确认板书 AAᵀ/(N−1),修正字幕容易混淆的转置位置。 样本协方差公式另核对教材印刷第 76 页;无偏性的抽样条件为本页补充。
AAᵀ 的维数是特征数×特征数;转置约定改变时公式也随之改变。
N−1 的缩放影响方差数值,但不改变主方向。
最后的连接:主方向是 u₁,强度才是 σ₁
用一个方向描述点云,最后回到最佳秩一近似。
临近下课,Strang 想用一条直线总结身高和年龄的关系。他先说最佳比例是 ,随后在约 46:27 自己停下来纠正:要找的是指向正确方向的向量,应该是 ,并表示下次再正式完成推导。复习时应保留这个纠正,不能把前面的口误当成结论。
在本讲“样本为列”的约定下, 给出
因此第一主方向是左奇异向量 ,也是样本协方差矩阵最大特征值对应的单位特征向量。它决定直线朝哪里走; 决定这个方向上保留多少平方能量,样本方差则为 。
若 且 ,在中心化坐标中直线斜率是 ;在原始坐标中为 。若 ,最佳线竖直,应使用参数式 ,不应强行求一个有限斜率。 与 表示同一条线。
把本讲前后接起来的补充。 将全部样本投影到这条线上:
所以 PCA 的最佳一维重建,正是中心化数据的最佳秩一近似。沿直线的样本坐标(scores)为 ;方向、坐标和强度是不同对象。推广到前 个方向,重建为 ,总平方残差为 ,在 时保留的方差比例为
这部分补全了课堂留到以后展开的推导。若最大奇异值重复,第一条最佳主轴可以不唯一;若数据全相同,中心化后 ,没有由变化决定的优先方向,方差比例的分母也为零。
现在回看整讲:SVD 给出正交方向和强度,范数衡量丢弃的信息,Eckart–Young 保证截断的最优性,中心化与协方差把它们连接到 PCA。
45:00–47:14 完整字幕核对,特别保留 46:27–46:54 的课堂自我纠正;正式 PCA 推导为教材与本页补充。 u₁ 主方向、总方差与 PCA 关系已核对教材印刷第 75–78 页;统一保留样本方差的 N−1 缩放。
主方向是 u₁,斜率是其两个坐标的比值,不能把斜率写成 σ₁。
PCA 重建是中心化矩阵的截断 SVD,解释方差要用奇异值的平方。
CLOSE THE LOOP
合上讲义,还能讲清楚吗?
用几道问题,检查你是否掌握了这一讲的关键区别。
概念索引 · 中英术语对照
- 截断 SVD Truncated SVD
仅保留最大的 k 个奇异值及其配对奇异向量得到的矩阵 Aₖ。
- 最佳低秩近似 Best low-rank approximation
在指定范数下,寻找秩至多 k 的矩阵,使其与已知矩阵的距离最小。
- 谱范数 Spectral norm
由向量欧氏范数诱导的矩阵范数,等于最大奇异值。
- Frobenius 范数 Frobenius norm
全部元素平方和的平方根,也等于全部奇异值平方和的平方根。
- 核范数 Nuclear norm
全部奇异值之和,常用于低秩结构的凸优化建模。
- 正交不变性 Orthogonal invariance
左、右乘适当维数的正交矩阵后,范数不改变。
- 稀疏 Sparse
向量有许多恰好为零的分量;矩阵有许多恰好为零的元素。
- 矩阵补全 Matrix completion
从部分已知矩阵元素与结构假设估计其余缺失元素。
- 中心化 Centering
每个样本减去样本均值向量,使每个特征的均值为零。
- 样本协方差 Sample covariance
从中心化样本计算特征间共同变化的矩阵;本讲约定为 AAᵀ/(N−1)。
- 第一主方向 First principal direction
使投影方差最大的单位方向;样本为列时为 A 的第一左奇异向量 u₁。
- 主成分坐标 Principal component scores
样本在主方向上的投影坐标;第一组为 u₁ᵀA=σ₁v₁ᵀ。
- 解释方差比例 Explained variance ratio
在总方差非零时,选定主方向的奇异值平方和占全部奇异值平方和的比例。