Σ矩阵的语言STRANG / FIELD NOTES
MIT 18.065/2
课程地图
LECTURE 02 48:24 原课

矩阵相乘与分解

Multiplying and Factoring Matrices

从列乘行到 LU 与四个基本子空间。

这节课的核心问题

这节课用列乘行的外积把矩阵相乘、对称谱分解和 LU 串成一条主线,再转向四个基本子空间:先计独立约束,再证明正交。保留真实课堂矩阵、学生回答与证明的适用条件;两项补充实验分别检验三种乘法视角和消元边界。

读完后,你应该能
  • 能在内积、列组合、外积三种视角间转换并检查维数。

  • 能解释非零外积为何秩一,并写出 AB 的列乘行展开。

  • 能从消元乘数构造 LU,识别零主元和换行条件。

  • 能计算四个基本子空间的维数并证明行空间与零空间正交。

一张地图:五种分解为什么放在一起?

乘法把因子组合为矩阵,分解则揭示矩阵内部结构;LU 和 QR 分别通向消元与最小二乘。

课程开头说明前一两周快速回顾线性代数的核心工具,并与后续计算、数据应用结合。本讲承接第 1 讲的“列乘行”,把同一个乘法观点放进五种基本分解:

分解 因子携带的信息 使用条件或用途
A=LUA=LU 下三角 LL、上三角 UU 消元;无换行版本需要相应主元条件
A=QRA=QR 正交归一列 QQ、上三角 RR Gram–Schmidt、最小二乘
S=QΛQTS=Q\Lambda Q^{\mathsf T} 正交特征向量、实特征值 实对称矩阵
A=XΛX1A=X\Lambda X^{-1} 特征向量基与特征值 方阵有完整独立特征向量组
A=UΣVTA=U\Sigma V^{\mathsf T} 左右奇异向量与奇异值 任意实矩阵,包括矩形矩阵

课堂先问学生 QRQR 中的字母 QQ 表示什么:orthogonal 表示方向互相垂直;orthonormal 还要求每一列长度为 1。后者使 QTQ=IQ^{\mathsf T}Q=I。当 QQ 是方阵时,便有 Q1=QTQ^{-1}=Q^{\mathsf T};只有正交列的矩形 QQ 不应被说成可逆。

这是一张课程地图,不是五种算法的完整推导。本讲随后选择谱分解演示外积,选择 LULU 演示消元;QRQR 的算法与 SVD 的构造留待后续。表中一般对角化的条件同时参考教材作了明确化。

核对与补充说明

字幕 00:22–03:12 完整核对;06:45 板书展示五种分解;教材 I.2 印刷11 / PDF25 已目视核对。

带走这几点
  • Q 通常表示正交归一的列;方阵 Q 才有 Q⁻¹=Qᵀ。

  • 每种分解保留不同的信息,不能忽略其成立条件。

实对称矩阵:完整的正交特征向量组

谱定理保证实对称矩阵有实特征值和一组正交归一特征向量;“可以选择”很重要。

Strang 把 S=QΛQTS=Q\Lambda Q^{\mathsf T} 单独拿出来。S=STRn×nS=S^{\mathsf T}\in\mathbb R^{n\times n}Λ\Lambda 是对角矩阵,Q=[q1  qn]Q=[q_1\ \cdots\ q_n] 的列是特征向量:

Sqi=λiqi,qiTqj={1i=j,0ij.Sq_i=\lambda_iq_i,\qquad q_i^{\mathsf T}q_j=\begin{cases}1&i=j,\\0&i\ne j.\end{cases}

课堂问两个事实:“特征向量有什么特别之处?特征值呢?”答案分别是可选择为正交归一的一组全部是实数。还不能漏掉一个看似隐含的条件:有完整的 nn 个独立方向,所以 QQ 真的是一组基,SS 可以被对角化。

老师在 05:45 特意把“特征向量是正交的”改成“可以选择成正交归一的”。补充解释: 重特征值的特征空间里,任意选出的两个向量未必正交;我们可以在这个空间中选正交基。实对称矩阵保证总能这样选,并不要求特征值互不相同。单位矩阵就是最简单的提醒:所有方向都是它的特征方向。

QR 和谱分解虽然都出现 QQ,含义并不相同。Gram–Schmidt 把给定列向量正交化,并不会自动把它们变成某个矩阵的特征向量;求特征方向还需要额外工作。

核对与补充说明

字幕 03:12–05:51,特别是 05:45 的措辞修正;教材 I.2 印刷11–12 / PDF25–26 核对实谱、重根与完整基。

带走这几点
  • 实对称性保证实谱及完整正交特征基。

  • 不要把“可以选正交基”误读为任意特征向量都正交。

外积积木:列乘行为何产生秩一?

一个内积给出一个数,一个外积给出一整块矩阵;非零外积的所有列共线。

要展开 QΛQTQ\Lambda Q^{\mathsf T},先把它看成两个因子的乘积 (QΛ)QT(Q\Lambda)Q^{\mathsf T}。这样就可以直接应用“第一个矩阵的列 × 第二个矩阵的行”。

uRmu\in\mathbb R^mvRpv\in\mathbb R^p,则 uvTuv^{\mathsf T}m×pm\times p 矩阵。课堂的具体例子是

[12][34]=[3468].\begin{bmatrix}1\\2\end{bmatrix}\begin{bmatrix}3&4\end{bmatrix}=\begin{bmatrix}3&4\\6&8\end{bmatrix}.

两列分别是 3u,4u3u,4u,两行分别是 vT,2vTv^{\mathsf T},2v^{\mathsf T}。所以列空间是一条直线,行空间也是一条直线。精确条件: 当两向量均非零时,外积秩为 1;有一个为零时,结果是秩为 0 的零矩阵。

对一般的 ARm×nA\in\mathbb R^{m\times n}BRn×pB\in\mathbb R^{n\times p},记 aka_kAA 的第 kk 列,bkTb_k^{\mathsf T}BB 的第 kk 行(这里不是转置 BB 的第 kk 列),则

AB=k=1nakbkT.AB=\sum_{k=1}^{n}a_kb_k^{\mathsf T}.

为何这与行乘列相同?右边第 (i,j)(i,j) 个条目恰好是 kaikbkj\sum_k a_{ik}b_{kj},也就是通常的内积公式。它不是新的乘法,而是同一批标量乘积换一种分组。教材的这一步检验补全了课堂的口头规则。

补充实验:三种视角算同一个乘积。 输入 A=[1031]A=\begin{bmatrix}1&0\\3&1\end{bmatrix}B=[2405]B=\begin{bmatrix}2&4\\0&5\end{bmatrix},比较行列内积、列组合与两个外积。先预测右下角,再确认结果是 [24617]\begin{bmatrix}2&4\\6&17\end{bmatrix};它的 17 来自 34+153\cdot4+1\cdot5,也来自两块右下角的 12+512+5。把 AA 第二列设为零,观察第二块外积消失。这个 2×2 算例来自教材印刷10页,实验是网站补充。

核对与补充说明

字幕 05:51–08:25;课堂外积例在 07:53–08:14;06:45 板书核对因子分组;教材 I.2 印刷9–10 / PDF23–24 已核对公式与补充实验算例。

MIT 18.065 · 课程补充实验

一个 AB,三种读法

观察任务改动 A、B 的条目,轮流核对内积条目、A 的列组合和列乘行外积;三栏应始终给出同一个 AB。

A
B
条目内积
(AB)ij=sumkaikbkj,quadAB=[410717](AB)_{ij}=sum_k a_{ik}b_{kj},quad AB=\begin{bmatrix}4&10\\7&17\end{bmatrix}
(1,1):2 + 2 = 4(1,2):6 + 4 = 10(2,1):3 + 4 = 7(2,2):9 + 8 = 17
列组合
AB=[Ab1  Ab2],(AB):,j=AbjAB=[A b_1\;A b_2],\quad (AB)_{:,j}=A b_j
a1=[23]a_1=\begin{bmatrix}2\\3\end{bmatrix}a2=[12]a_2=\begin{bmatrix}1\\2\end{bmatrix}b1T=[13]b_1^T=\begin{bmatrix}1&3\end{bmatrix}b2T=[24]b_2^T=\begin{bmatrix}2&4\end{bmatrix}

每个 AB 的列都是 A 对应列的线性组合;每个条目都是一行与一列的点积。

外积求和
AB=sumk=12akbkT=[410717]AB=sum_{k=1}^{2}a_kb_k^T=\begin{bmatrix}4&10\\7&17\end{bmatrix}
a1b1T=[2639]a_1b_1^T=\begin{bmatrix}2&6\\3&9\end{bmatrix}a2b2T=[2448]a_2b_2^T=\begin{bmatrix}2&4\\4&8\end{bmatrix}

每项外积秩至多 1;两项相加后得到完整矩阵,重建误差 0

当前三个视角的重建误差为 0;改变任意条目后,维数仍是 2×2。

第 1–2 讲:逐条目点积、按 A 的列组合 B 的列,以及 AB=Σaₖbₖᵀ;教材印刷第 9 页 / OCR PDF 第 23 页核对外积。

补充实验 · 改变一个量,观察同一数学状态的图形与数值
带走这几点
  • 乘法的内积和外积视角给出同一 AB。

  • 外积的秩至多为 1;非零时恰为 1。

右乘对角矩阵:把谱分解拆成 n 块

QΛ 的第 i 列是 λᵢqᵢ,因此 S 是对称外积 λᵢqᵢqᵢᵀ 之和。

外积规则已经备好,剩下的问题是:QΛQ\Lambda 的第一列到底是什么? 课堂没有直接跳到答案,而是让学生看对角矩阵的第一列:除了 λ1\lambda_1,其余都是零。根据列组合规则,

(QΛ):,1=λ1q1.(Q\Lambda)_{:,1}=\lambda_1q_1.

同理,第 ii 列就是 λiqi\lambda_iq_i。注意乘法的方向:在右边乘对角矩阵是缩放列;若在左边乘,则缩放行。

QTQ^{\mathsf T} 的第 ii 行是 qiTq_i^{\mathsf T}。把对应列和行相乘相加,得到

S=(QΛ)QT=λ1q1q1T++λnqnqnT.S=(Q\Lambda)Q^{\mathsf T}=\lambda_1q_1q_1^{\mathsf T}+\cdots+\lambda_nq_nq_n^{\mathsf T}.

每个 qiqiTq_iq_i^{\mathsf T} 都对称,因为转置后还是它自身。这使对称矩阵被拆成了保持对称性的简单块,比逐条目读取 SS 更能说明结构。如果某个 λi=0\lambda_i=0,对应加权块就是零;如果 λi<0\lambda_i<0,该块带负权重,谱分解依然成立。不要把特征值误限制成奇异值那样的非负数。

核对与补充说明

字幕 08:25–11:06;教材 I.2 印刷12 / PDF26 核对式 (6)–(8)、按列缩放及谱展开。

带走这几点
  • QΛ 的各列分别乘以相应 λᵢ。

  • S 的每个加权外积仍对称;零特征值对应零块。

为什么只需在特征向量上检查?

正交性让其他块消失,单位长度让目标块留下 λᵢqᵢ;完整基使这一检查确定整个矩阵。

现在把上面的和记成 TT,Strang 问:怎样检查它确实就是 SS?先计算 Tq1Tq_1

Tq1=j=1nλjqj(qjTq1).Tq_1=\sum_{j=1}^{n}\lambda_jq_j(q_j^{\mathsf T}q_1).

学生回答第二项为零,因为 q2Tq1=0q_2^{\mathsf T}q_1=0。同理,所有 j1j\ne1 的项都为零,留下

Tq1=λ1q1(q1Tq1)=λ1q1=Sq1.Tq_1=\lambda_1q_1(q_1^{\mathsf T}q_1)=\lambda_1q_1=Sq_1.

这里用到两件不同的事:正交消掉其他方向,归一化使 q1Tq1=1q_1^{\mathsf T}q_1=1。不是把某个向量“约掉”,也没有把矩阵乘法交换顺序。

同一个推理适用于每个 qiq_i。为什么这足以说明 T=ST=S?因为这些 qiq_i 组成整个 Rn\mathbb R^n 的基。任意 x=iciqix=\sum_i c_iq_i,由线性性可得 Tx=iciTqi=iciSqi=SxTx=\sum_i c_iTq_i=\sum_i c_iSq_i=Sx。只检查一个方向当然不够;检查完整基才确定整个线性变换。

证明范围要分清: 此处是在已经拥有正交特征基的前提下检验谱展开,并没有从头证明每个实对称矩阵都拥有这组基。后一个存在性命题才是谱定理的更深部分。作为补充直觉,qiqiTx=qi(qiTx)q_iq_i^{\mathsf T}x=q_i(q_i^{\mathsf T}x) 是沿 qiq_i 的正交投影,而 λi\lambda_i 再给它加上伸缩权重。

核对与补充说明

字幕 11:06–14:50,包含课堂逐项问答;教材 I.2 印刷12 / PDF26 核对谱展开及存在性证明范围;完整基检验与投影视角为补充说明。

带走这几点
  • 每个秩一投影只保留输入沿自身方向的分量。

  • 同一组完整基上的作用相同,才可推出两个矩阵相同。

为什么 SVD 需要两组方向?

特征分解可能缺少完整特征基;SVD 用输入和输出两组正交方向适配每个矩阵。

Strang 回到分解地图,特别强调第五项 A=UΣVTA=U\Sigma V^{\mathsf T}。它的三个因子可以读成“正交、对角、正交”,但两边分别用 U,VU,V,因为这里有两组不同的方向。

普通对角化 A=XΛX1A=X\Lambda X^{-1} 需要 nn 个独立特征向量。有些方阵缺少这么多特征向量;矩形矩阵更不能直接套用同一个特征方程。SVD 则允许输入方向和输出方向不同,所以适用于每个实矩阵。

维数补全:ARm×nA\in\mathbb R^{m\times n},完整形式中 UUm×mm\times m 正交矩阵,VVn×nn\times n 正交矩阵,Σ\Sigmam×nm\times n 的矩形对角矩阵。后续会解释 Avi=σiuiAv_i=\sigma_i u_i,其中 viv_i 在输入空间、uiu_i 在输出空间。此处不是要求矩形 AA 本身成为正交矩阵。

课堂只是预告这个将在数据科学中反复出现的分解,没有在本讲计算奇异向量或证明 SVD 的存在性。可以在完成本讲后到第 6 讲查看构造,再到第 7 讲看秩一成分怎样用于最佳近似。

核对与补充说明

字幕 14:50–16:59;06:45、20:25 板书包含 SVD 因子;教材 I.2 印刷11 / PDF25 核对适用范围。完整 SVD 尺寸为补充澄清。

带走这几点
  • 一般特征分解的完整基条件不可省略。

  • SVD 的 U 和 V 分别描述输出与输入空间。

课堂 2×2 消元:L 为什么放正的乘数?

第二行减去第一行的 2 倍得到 U;L 用 +2 恢复原矩阵,而消元矩阵用 −2。

课堂回到最常见的任务 Ax=bAx=b。两个方程耦合在一起,不容易直接读取未知数;消元要先把第二个方程中的第一个未知数去掉。黑板上的矩阵是

A=[2347].A=\begin{bmatrix}2&3\\4&7\end{bmatrix}.

第二行减去第一行的 2 倍,得到

U=[2301],723=1.U=\begin{bmatrix}2&3\\0&1\end{bmatrix},\qquad 7-2\cdot3=1.

主元是 UU 对角线上的 2 和 1。课堂问“那么 LL 是什么”,答案是把刚刚用到的乘数 2 存入下三角:

L=[1021],A=LU.L=\begin{bmatrix}1&0\\2&1\end{bmatrix},\qquad A=LU.

为何是 +2+2 而不是 2-2 消元从 AAUU,使用 E=[1021]E=\begin{bmatrix}1&0\\-2&1\end{bmatrix};分解从 UU 恢复 AA,所以 L=E1L=E^{-1}。直接相乘,LULU 的第二行是 2[2,3]+[0,1]=[4,7]2[2,3]+[0,1]=[4,7]。这是补充核验,避免把消元矩阵和 LL 混为一谈。

若写右端为 (b1,b2)T(b_1,b_2)^{\mathsf T},同一行操作也必须作用于它。新方程为 y=b22b1y=b_2-2b_1,再由 2x+3y=b12x+3y=b_1 回代。这个符号右端是为课堂“消去耦合”动机补全的计算,并非新增课堂给定数字。

字幕校正: 19:05 附近的“2,4,3,7”是口述顺序,不能直接当作逐行输入。20:25 板书与后续消元一致地给出上面的 [2,3;4,7][2,3;4,7]。教材印刷25页也用这同一系数矩阵,但另外给了一个具体右端。

核对与补充说明

字幕 16:59–22:05;20:25 板书核对 A 与 U;教材 I.4 印刷24–25 / PDF38–39 目视核对 L 乘数、同一 2×2 系数矩阵与三角求解。

带走这几点
  • L 的乘数为正,因为它把 U 恢复到 A。

  • 系数矩阵行操作必须同步应用于右端 b。

把第一行和第一列一起“剥下来”

第一块同时匹配 A 的第一行、第一列;秩一条件强制右下角为 6,留下第二主元 1。

老师希望换一种看法:消元不只是把一个位置改成零,而是把整个矩阵拆成容易理解的块。对课堂矩阵,先要求第一块保留 AA 的第一行和第一列:

[2347]=[234]+[000].\begin{bmatrix}2&3\\4&7\end{bmatrix}=\begin{bmatrix}2&3\\4&\square\end{bmatrix}+\begin{bmatrix}0&0\\0&\triangle\end{bmatrix}.

如果第一块必须秩一,空格里应该是什么?第二行已经必须是第一行的 2 倍,因此 =6\square=6;剩下 =76=1\triangle=7-6=1。字幕的“6.6”“7.6”是相邻句子被识别成小数,实际含义是“填 6;7 中减去 6 留下 1”。

现在两块都能写成列乘行:

A=[12][23]+[01][01].A=\begin{bmatrix}1\\2\end{bmatrix}\begin{bmatrix}2&3\end{bmatrix}+\begin{bmatrix}0\\1\end{bmatrix}\begin{bmatrix}0&1\end{bmatrix}.

前面的两列正好是 LL 的两列,后面的两行正好是 UU 的两行。因此这个和不是另一个偶然分解,而是 LULU 的外积展开。

为什么不能直接拿 AA 的原第一列乘原第一行?那会把左上主元 2 重复算进去。正确第一块是

A:,1A1,:a11=12[24][23].\frac{A_{:,1}A_{1,:}}{a_{11}}=\frac{1}{2}\begin{bmatrix}2\\4\end{bmatrix}\begin{bmatrix}2&3\end{bmatrix}.

除以主元等价于把第一列归一成 LL 中顶端为 1 的列。这个校正是后面推广到更大矩阵的关键。

核对与补充说明

字幕 22:05–25:12,特别是 24:26–24:40 的数字口述;20:25 板书、教材 I.4 印刷24–25 / PDF38–39 的 LU 与相同算例核对;主元归一公式为课堂思路的显式写法。

带走这几点
  • 秩一条件决定第一块的内部条目。

  • 从原行、列构造第一块时必须除以主元。

从小矩阵到递归消元:剩余块是什么?

每次剥离一个秩一块,下一步处理更新后的子矩阵;主元为零时必须区分换行与奇异。

Strang 坦言,对于 2×2,这种解释看起来像把简单事情做复杂;它真正的价值在于显示大矩阵消元的结构。下一步用的不是原矩阵未经修改的第二行、第二列,而是剩余块的新行、新列。

用分块记号补全这件事。设首主元 p0p\ne0,写成

A=[pwTvD]=[1v/p][pwT]+[000DvwT/p].A=\begin{bmatrix}p&w^{\mathsf T}\\v&D\end{bmatrix}=\begin{bmatrix}1\\v/p\end{bmatrix}\begin{bmatrix}p&w^{\mathsf T}\end{bmatrix}+\begin{bmatrix}0&0\\0&D-vw^{\mathsf T}/p\end{bmatrix}.

右下剩余块 A2=DvwT/pA_2=D-vw^{\mathsf T}/p 通常称为 Schur 补(名称为补充)。对它重复同一操作,得到 A3A_3,依次进行直到最后一个主元;把各层列和行收集起来,正好形成下三角 LL 和上三角 UU。本课没有完整算一个 3×3 数字例,只解释了这条递归路线。

补充实验:把边界也算进去。 输入 A=[p,q;r,s]=[2,3;4,7]A=[p,q;r,s]=[2,3;4,7],先看到乘数 r/p=2r/p=2、第二主元 srq/p=1s-rq/p=1 及重建 LU=ALU=A。只把 ss 改为 6,第二主元变为零,矩阵秩降为 1,但这个 LULU 乘积仍然存在;不能因为奇异就说“没有任何 LU”。

再输入 [0,1;1,0][0,1;1,0]:首主元为零,但行列式是 1-1,矩阵并不奇异。交换两行以后可做消元,记录为 PA=LUPA=LU。最后把第一列都设为零,矩阵必然奇异,换行也无法创造非零首主元。一般 p0p\ne0 时,

detA=p(srqp)=psqr.\det A=p\left(s-\frac{rq}{p}\right)=ps-qr.

因此实验同时区分了当前消元顺序不可用矩阵本身不可逆。换行及奇异边界按教材作补充,不假装课堂已详细演示。

核对与补充说明

字幕 25:12–27:26;教材 I.4 印刷24–26 / PDF38–40 已目视核对递归、非零主元及 PA=LU;分块公式、Schur 补名称和边界实验为补充。

MIT 18.065 · 课程补充实验

把消元记录成 LU:零主元意味着什么?

观察任务改变 2×2 矩阵,观察消元乘数、第二主元与 LU 重建;输入零主元时区分换行和真正奇异。

A
m21=r/p,U=[pq0srq/p],A=LUm_{21}=r/p,\quad U=\begin{bmatrix}p&q\\0&s-rq/p\end{bmatrix},\quad A=LU
m₂₁2消元乘数
第二主元1更新后的对角元
det(A)2可逆
P=[1001],quadL=[1021],quadU=[2301]P=\begin{bmatrix}1&0\\0&1\end{bmatrix},quad L=\begin{bmatrix}1&0\\2&1\end{bmatrix},quad U=\begin{bmatrix}2&3\\0&1\end{bmatrix}

第二行减去 m₂₁ 倍第一行,L 保存正的乘数以恢复 A。

两行向量蓝第一行;橙第二行 · 共同坐标尺度 ±8
x₁x₂row₁row₂

当前 PA 与 LU 的最大重建误差为 0。零主元只说明当前顺序不能直接除;若下方行有非零项,应换行并记录 P。

第 2 讲:课堂矩阵 A=[2,3;4,7] 与 L=[1,0;2,1]、U=[2,3;0,1];教材 I.4 印刷第 24–26 页 / OCR PDF 第 38–40 页补充 PA=LU。

补充实验 · 改变一个量,观察同一数学状态的图形与数值
带走这几点
  • 每一步必须使用更新后的剩余块。

  • 零主元不等于奇异;奇异也不等于任何 LU 都不存在。

四个基本子空间:为什么要凑齐四个?

列空间和行空间都具有维数 r,另外两部分是 Ax=0 与 Aᵀy=0 的解空间。

在短暂回顾后,Strang 说后续会反复使用 QRQR、对称谱分解和 SVD,然后转向线性代数的“大图景”。他提到收到一道来自印度、涉及基本定理的作业题,原打算讲完定理再讨论;本讲最终没有给出那道题的题面或解答,不能据此补造一道课堂问题。

从一个 m×nm\times n、秩为 rr 的实矩阵 AA 出发,四个空间是

C(A),C(AT),N(A),N(AT).C(A),\quad C(A^{\mathsf T}),\quad N(A),\quad N(A^{\mathsf T}).

C(A)C(A) 是所有列的线性组合,C(AT)C(A^{\mathsf T}) 是所有行的线性组合(把行转成列来表示向量)。第 1 讲证明了行秩等于列秩,所以

dimC(A)=dimC(AT)=r,rmin(m,n).\dim C(A)=\dim C(A^{\mathsf T})=r,\qquad r\le\min(m,n).

老师让大家想象一个 50×10050\times100 的矩阵:100 个列向量与 50 个行向量虽然数量和长度都不同,能从中选出的最大独立向量数却相同。这比小例子中的“看起来一样”要强得多。

另外两个空间由方程定义:N(A)={x:Ax=0}N(A)=\{x:Ax=0\}N(AT)={y:ATy=0}N(A^{\mathsf T})=\{y:A^{\mathsf T}y=0\}。它们不是从矩阵里直接摘几行或几列,而是求齐次方程得到的向量集合。下一步要问:它们为什么确实是子空间?又各有多少独立方向?

核对与补充说明

字幕 27:26–32:26,包含未展开的印度作业题轶事和 50×100 比较;教材 I.3 印刷14 / PDF28 目视核对四空间定义。

带走这几点
  • 行、列空间由线性组合定义;零空间由齐次方程定义。

  • 行秩与列秩相同,不表示行空间与列空间相同。

为什么零空间对线性组合封闭?

Ax=0 与 Ay=0 推出 A(αx+βy)=0;“零”右端保证解集通过原点并形成子空间。

零空间的名字来自右端的零向量。它之所以适合做线性代数,是因为它对加法和数乘都封闭。课堂先取 x,yN(A)x,y\in N(A),写出

A(x+y)=Ax+Ay=0+0=0.A(x+y)=Ax+Ay=0+0=0.

所以 x+yx+y 仍在零空间。再对任意实数 cc

A(cx)=cAx=0.A(cx)=cAx=0.

把两步合起来,就得到任意线性组合 αx+βy\alpha x+\beta y 仍然属于 N(A)N(A)。此外 A0=0A0=0,零向量本身也在这个集合中。因此我们可以在里面选基、讨论维数、进行通常的向量运算。

补充对照: Ax=bAx=bb0b\ne0 的解集一般不是子空间。若 Ax=Ay=bAx=Ay=b,则 A(x+y)=2bA(x+y)=2b,通常不再等于 bb;而零向量也不满足方程。它在有解时是“一个特解加上 N(A)N(A)”,是平移后的仿射空间。这解释了为什么定义基本子空间时要使用齐次方程。

核对与补充说明

字幕 32:26–35:03;36:30、46:30 板书可见 Ax=0、Ay=0、A(x+y)=0、A(cx)=0;教材 I.3 印刷14 / PDF28 定义核对;非齐次对照为补充。

带走这几点
  • 封闭性来自矩阵乘法的线性。

  • 非齐次解集和零空间不能混称为子空间。

先看向量长度:哪些空间应该放在一起?

输入侧的行空间与零空间位于 Rⁿ,输出侧的列空间与左零空间位于 Rᵐ。

老师把四个空间画成两对。原因首先不是“它们看起来相似”,而是同一对中的向量有相同的分量数:

所在空间 第一部分 第二部分
输入空间 Rn\mathbb R^n 行空间 C(AT)C(A^{\mathsf T}) 零空间 N(A)N(A)
输出空间 Rm\mathbb R^m 列空间 C(A)C(A) 左零空间 N(AT)N(A^{\mathsf T})

课堂先画一般 m×nm\times n 矩阵,再用 2×32\times3 的形状提示维数:每一行有 3 个数,输入 xx 也有 3 个分量,所以行空间和 N(A)N(A) 都在 R3\mathbb R^3。每一列有 2 个数,输出是二维;ATy=0A^{\mathsf T}y=0 中的 yy 也有 2 个分量,所以另外两个空间在 R2\mathbb R^2

这里“行长度为 3”指有 3 个分量,不是欧几里得范数等于 3。同样,空间位于 R3\mathbb R^3 不代表它自身维数就是 3;它可能是直线、平面或仅含零向量。先分清环境维数,下一节的 r,nr,mrr,n-r,m-r 才不会填错位置。

核对与补充说明

字幕 35:03–38:08;36:30 板书核对四空间分组;教材 I.3 印刷14–15 / PDF28–29 目视核对二维/三维图。

带走这几点
  • 环境空间看向量有几个分量,自身维数看有几个独立方向。

  • 必须把 N(A) 配给行空间,而不是列空间。

独立约束计数:n−r 与 m−r 从哪里来?

n 个未知数只有 r 个独立约束,留下 n−r 个自由方向;转置后同理得到 m−r。

课堂把同一个问题反复换说法:“Ax=0Ax=0 看似有 mm 个方程,真正独立的有多少个?有多少个独立解?”由于行秩为 rr,只有 rr 个真正独立的约束,其余方程是这些约束的线性组合。

xxnn 个未知分量,约束消去 rr 个自由度,因而

dimN(A)=nr.\dim N(A)=n-r.

把计数说精确: 在阶梯形中,有 rr 个主元变量和 nrn-r 个自由变量。依次让某个自由变量为 1、其余自由变量为 0,求出主元变量,得到 nrn-r 个独立解;所有解都是它们的线性组合。这是为课堂自由度说法补上的代数依据。

不要把“nrn-r 个独立解”说成总共只有 nrn-r 个解。当维数大于零时,实数域上有无穷多个解;维数为零时,只有零解。

再把 AA 换为 ATA^{\mathsf T},未知量有 mm 个、秩仍为 rr,所以

dimN(AT)=mr.\dim N(A^{\mathsf T})=m-r.

因此输入侧的维数和是 r+(nr)=nr+(n-r)=n,输出侧是 r+(mr)=mr+(m-r)=m。老师强调左零空间不能被遗漏,否则图景只完成了四分之三。每个输入都能分成行空间和零空间两部分;单凭维数和还不足以证明这种分解唯一,接下来还需两个空间正交,从而交集只有零向量。

核对与补充说明

字幕 38:08–42:04,特别是 39:45 的 n−r 与 41:29 的 m−r;46:30 板书上方核对 r、n−r、r、m−r;教材 I.3 印刷15 / PDF29 核对自由解计数。

带走这几点
  • rank-nullity 数的是独立自由方向,不是解的总个数。

  • 维数相加恰好填满环境空间,还要结合正交关系。

课堂 2×3 例:直线与平面的具体向量

A=[1,2,4;2,4,8] 的秩为 1;课堂找到的两个零空间基向量是 (0,−2,1) 和 (4,0,−1)。

仅仅填对维数还不够。Strang 要进一步问这两块空间如何摆放,于是写下课堂矩阵

A=[124248],m=2, n=3, r=1.A=\begin{bmatrix}1&2&4\\2&4&8\end{bmatrix},\qquad m=2,\ n=3,\ r=1.

第二行是第一行的两倍;三列都沿 (1,2)T(1,2)^{\mathsf T}。因此行空间由 (1,2,4)T(1,2,4)^{\mathsf T} 张成,是 R3\mathbb R^3 里的直线;零空间维数是 31=23-1=2,应该是一张过原点的平面。

课堂请学生给出两个独立解,最后在板书上保留的是

x(1)=[021],x(2)=[401].x^{(1)}=\begin{bmatrix}0\\-2\\1\end{bmatrix},\qquad x^{(2)}=\begin{bmatrix}4\\0\\-1\end{bmatrix}.

直接代入唯一独立约束 x1+2x2+4x3=0x_1+2x_2+4x_3=0:第一向量得到 04+4=00-4+4=0,第二向量得到 4+04=04+0-4=0。它们不互为倍数,因此是两个独立解;由于已知零空间维数为 2,它们构成一组基。

补充完整解: 若令系数为 α,β\alpha,\beta,则

x=αx(1)+βx(2)=[4β2ααβ].x=\alpha x^{(1)}+\beta x^{(2)}=\begin{bmatrix}4\beta\\-2\alpha\\\alpha-\beta\end{bmatrix}.

任意满足约束的 xx 都可以这样写:取 β=x1/4\beta=x_1/4α=x2/2\alpha=-x_2/2,第三个分量由约束自动吻合。两个基向量的点积为 1-1,所以它们彼此并不正交;这不妨碍它们作为零空间的基。接下来要求的正交关系,是整个零空间与行空间之间的关系。

字幕 45:32 的“1.4”“0.6”等混乱数字不能作数学依据;这里已按 46:30 板书核正。教材印刷15页给的是另一个 2×3 秩一矩阵,几何结构相同,但数字不可替换成本课原例。

核对与补充说明

字幕 42:04–45:58;46:30 板书目视核对原矩阵和两组基向量;教材 I.3 印刷15 / PDF29 核对同类几何,数值例不同;通解系数及点积为补充计算。

带走这几点
  • 用独立性加上正确维数,才能确认找到了整个零空间的基。

  • 零空间内的两个基向量不必互相正交。

Ax=0 就是在说正交:完成基本定理

矩阵乘法逐行就是点积,所以 N(A) 恰为行空间的正交补;转置得到另一对空间的正交关系。

现在对着课堂向量,老师问 (1,2,4)(1,2,4)(0,2,1)(0,-2,1) 是什么关系。点积 04+4=00-4+4=0,所以它们正交。这并非算例巧合,而是矩阵方程的逐行含义。

AA 的第 ii 行记为 aiTa_i^{\mathsf T},则

Ax=[a1TxamTx]=0aiTx=0 对所有 i.Ax=\begin{bmatrix}a_1^{\mathsf T}x\\\vdots\\a_m^{\mathsf T}x\end{bmatrix}=0\quad\Longleftrightarrow\quad a_i^{\mathsf T}x=0\ \text{对所有 }i.

于是 xx 与每一行正交,也与这些行的任意线性组合正交。反过来,与整个行空间正交当然包含与每一行正交,所以

N(A)=C(AT).N(A)=C(A^{\mathsf T})^{\perp}.

ATA^{\mathsf T} 做完全相同的论证,就有

N(AT)=C(A).N(A^{\mathsf T})=C(A)^{\perp}.

基本定理的两部分终于接上: 维数分别是 r,nrr,n-rr,mrr,m-r;几何上,同一环境空间中的两部分互为正交补。因此

Rn=C(AT)N(A),Rm=C(A)N(AT).\mathbb R^n=C(A^{\mathsf T})\oplus N(A),\qquad \mathbb R^m=C(A)\oplus N(A^{\mathsf T}).

符号 \oplus 表示唯一分解:每个输入 x=xrow+xnullx=x_{\rm row}+x_{\rm null}。为何唯一?若有两种写法,相减后一个向量同时在行空间和零空间,于是它必须与自身正交,长度平方为零,只能是零。这个简短证明补全了课堂“每个向量都有两部分”的说法。Ax=AxrowAx=Ax_{\rm row},所以零空间恰好描述矩阵忽略的输入方向。

回到 2×3 例,输出侧是 C(A)=span{(1,2)T}C(A)=\operatorname{span}\{(1,2)^{\mathsf T}\}N(AT)=span{(2,1)T}N(A^{\mathsf T})=\operatorname{span}\{(2,-1)^{\mathsf T}\},也互相垂直;这是按同一原矩阵补出的另一半图景。末尾预告将转向特征值和正定矩阵;关于讲义副本与下周安排不新增数学结论。

核对与补充说明

字幕 45:58–48:24;46:30 板书核对原例点积与四个维数;教材 I.3 印刷14–15 / PDF28–29 的正交图核对;双向证明、唯一分解及左零空间计算为补充。

带走这几点
  • Ax=0 等价于输入与每一行正交,进而与整个行空间正交。

  • 四空间必须按输入与输出两侧配对;每侧都是正交直和。

CLOSE THE LOOP

合上讲义,还能讲清楚吗?

用几道问题,检查你是否掌握了这一讲的关键区别。

概念索引 · 中英术语对照
外积 outer product

列向量乘行向量得到矩阵;两向量均非零时结果秩一。

正交归一 orthonormal

各向量互相正交且每个长度为1;比只要求正交多一个归一化条件。

谱分解 spectral decomposition

实对称矩阵可由正交特征方向及实特征值表示为 QΛQᵀ。

消元乘数 elimination multiplier

从目标行减去多少倍主元行;单位下三角 L 保存这些倍数。

主元 pivot

消元当前使用的非零系数,三角形式下位于 U 对角线上;零主元需要重新选择行或处理秩亏。

Schur 补 Schur complement

剥离某个主元对应秩一块后留下的更新子矩阵;本讲补充采用此名称。

零空间 nullspace

所有满足 Ax=0 的输入向量构成的子空间,维数 n−r。

左零空间 left nullspace

所有满足 Aᵀy=0 的向量构成的子空间,位于 Rᵐ,维数 m−r。

正交补 orthogonal complement

与某个子空间的所有向量正交的向量集合;必须处在同一环境空间中。

学习整理 · 原课:MIT OpenCourseWare / Gilbert Strang · 教材:Linear Algebra and Learning from Data