Σ矩阵的语言STRANG / FIELD NOTES
MIT 18.065/3
课程地图
LECTURE 03 49:23 原课

正交矩阵:旋转、反射与多尺度基

Orthonormal Columns in Q Give QᵀQ = I

从 QᵀQ=I 出发,认识保持几何结构的矩阵家族。

这节课的核心问题

本讲用 QᵀQ=I 统一旋转、反射、Householder、Hadamard、Haar 小波与 Fourier 基,沿课堂推理说明归一化、矩形维数和复内积的边界。内容依据完整字幕,关键公式用板书帧及用户指定的448页OCR教材交叉核对;未声称逐秒观看。duration 为视频完整时长2963.795秒,字幕最后一句结束于2962.51秒。

读完后,你应该能
  • 从列内积解释 QᵀQ=I,并区分高瘦 Q 与方阵。

  • 用 QᵀQ=I 证明长度、内积和角度保持。

  • 推导 H=I−2uuᵀ 的对称性、正交性和反射作用。

  • 识别 Hadamard/Haar/Fourier 的正交结构及归一化边界。

  • 在复 Fourier 向量中正确使用共轭转置。

把正交归一列写成 QᵀQ=I

对角线记录单位长度,非对角线记录正交;所有条件合成一个矩阵等式。

本讲从一个“每次看到 QTQQ^{\mathsf T}Q 就想到 II”的计算习惯开始。设 Q=[q1  qn]Rm×nQ=[q_1\ \cdots\ q_n]\in\mathbb R^{m\times n},其列互相正交且长度都是 1。乘积的第 (i,j)(i,j) 个条目正是 qiTqjq_i^{\mathsf T}q_j,所以

QTQ=[q1TqnT][q1  qn]=In.Q^{\mathsf T}Q=\begin{bmatrix}q_1^{\mathsf T}\\\vdots\\q_n^{\mathsf T}\end{bmatrix}[q_1\ \cdots\ q_n]=I_n.

“normal”贡献对角线上的 11,“ortho”贡献非对角线上的 00。反过来,若这个矩阵等式成立,读每个条目就得到列正交归一,因此这是完全等价的表达

注意它对矩形矩阵也成立:nn 个正交非零列一定线性无关,所以必须 nmn\le m。这里的 IIn×nn\times n;下节把乘法顺序调过来以后,尺寸变成 m×mm\times m,问题也随之改变。

核对与补充说明

完整字幕 00:21.59–01:55.31;OCR 教材印刷29/PDF43 页图核对式 (2)。

带走这几点
  • 正交与归一是两个不同条件,都不可省略。

  • QᵀQ=Iₙ 同时包含 n² 个列内积条件。

QQᵀ 为什么不总是 I?

方阵的左逆也是右逆;高瘦矩阵的 QQᵀ 则是到列空间的正交投影。

Strang 接着问:把顺序倒过来,QQTQQ^{\mathsf T} 也等于单位阵吗?方阵时是,高瘦矩阵时不是。m=nm=n,左逆 QTQ^{\mathsf T} 同时是右逆,因此

Q1=QT,QQT=QTQ=In.Q^{-1}=Q^{\mathsf T},\qquad QQ^{\mathsf T}=Q^{\mathsf T}Q=I_n.

这种实方阵才通常叫“正交矩阵”。名称里的 orthogonal 实际还包含各列已经单位化;矩形情形用“列正交归一”更准确。

教材补充:高瘦 Q 的另一种乘法。P=QQTP=QQ^{\mathsf T},则 PT=PP^{\mathsf T}=P,且

P2=Q(QTQ)QT=P.P^2=Q(Q^{\mathsf T}Q)Q^{\mathsf T}=P.

PbPbC(Q)C(Q) 中,误差 e=bPbe=b-Pb 满足 QTe=0Q^{\mathsf T}e=0,所以这是正交投影。重复投影不会再改变结果,但第一次一般会缩短向量。千万不要把“QQ 保持输入长度”误读成“QQTQQ^{\mathsf T} 保持所有输出空间向量的长度”。

补充实验。 实验使用单列 Q=q=(cosθ,sinθ)TQ=q=(\cos\theta,\sin\theta)^{\mathsf T}。调节方向角和 bb 的两个坐标,观察 qTq=1q^{\mathsf T}q=1,而 qqT=Pqq^{\mathsf T}=P2×22\times2 的投影。设 θ=0\theta=0b=(2,3)b=(2,3),应得到 p=(2,0)p=(2,0)e=(0,3)e=(0,3)。再令 bb 平行、垂直于 qq,分别观察 e=0e=0p=0p=0;始终有 pTe=0p^{\mathsf T}e=0b2=p2+e2\|b\|^2=\|p\|^2+\|e\|^2。这个二维示例是根据教材投影段设计的,不是课堂算例。

核对与补充说明

字幕 01:55.31–03:54.39;方阵条件核对印刷29/PDF43,补充投影核对印刷32/PDF46 页图式 (9)(10)。

MIT 18.065 · 课程补充实验

正交投影:一条方向与它的垂线

观察任务旋转 q,或改变 b 的两个分量。观察 p 与 e 如何始终满足 b=p+e、qᵀe=0;再比较 QᵀQ=[1] 与 QQᵀ=P≠I。

b 的分解蓝 q;绿 p;橙 e;紫 b · 共同坐标尺度 ±3
x₁x₂qpeb
qTq=1,p=q(qTb),e=bpq^Tq=1,\quad p=q(q^Tb),\quad e=b-p
qᵀe0应为 0
‖p‖2.21投影长度
‖e‖0.33正交残差

把 Q 取作单列 q 时,QᵀQ=[1];但 QQᵀ=P≠I 是投影矩阵。这里 P 对称且 P²=P。

P=[0.6710.470.470.329]P=\begin{bmatrix}0.671&0.47\\0.47&0.329\end{bmatrix}

q=(0.82, 0.57);b=(2, 1)。绿色 p 与橙色 e 从原点画出;它们按向量加法相加得到紫色 b。

改变 θ 不会破坏正交关系;当前 p=(1.81, 1.27),e=(0.19, −0.27)。

课堂/教材连接:第 3 讲的正交向量、投影与最小二乘;补充模型 q=(cos θ,sin θ),P=qqᵀ,便于把投影误差看成几何直角。

补充实验 · 改变一个量,观察同一数学状态的图形与数值
带走这几点
  • 方阵 Q 才能把 Qᵀ称为完整逆矩阵。

  • 矩形 QQᵀ 保留列空间分量,消去其正交补分量。

第一种二维例子:旋转整个平面

旋转矩阵的两列就是两条标准坐标轴转过 θ 后的位置。

Strang 先选单位列 (cosθ,sinθ)T(\cos\theta,\sin\theta)^{\mathsf T}。与它垂直的第二列可选 (sinθ,cosθ)T(-\sin\theta,\cos\theta)^{\mathsf T},得到

R(θ)=(cosθsinθsinθcosθ).R(\theta)=\begin{pmatrix}\cos\theta&-\sin\theta\\\sin\theta&\cos\theta\end{pmatrix}.

两列长度为 1,内积为 cosθsinθ+sinθcosθ=0-\cos\theta\sin\theta+\sin\theta\cos\theta=0,所以 RTR=IR^{\mathsf T}R=I。逆矩阵只需把转置写出来,它恰好是 R(θ)R(-\theta):反向转回去。

课堂从 e1=(1,0)Te_1=(1,0)^{\mathsf T} 出发。乘以 RR 就取出第一列,方向由 00 变成 θ\thetae2e_2 被送到第二列,方向同样转过 θ\theta。任意向量是这两条坐标轴的线性组合,所以整个平面一起旋转,而不是仅有两列发生变化。

作为核算,θ=π/2\theta=\pi/2R=(0110)R=\begin{pmatrix}0&-1\\1&0\end{pmatrix}(2,1)(2,1) 变成 (1,2)(-1,2);它转向但长度仍为 5\sqrt5。这个数值代入是补充练习。

核对与补充说明

字幕 03:54.39–05:40;05:10 帧核对旋转矩阵,印刷33/PDF47 式 (11) 及图1.8。

带走这几点
  • 读取矩阵的列,就是追踪标准基的像。

  • R(θ)ᵀ=R(−θ),转置表示反向旋转。

为什么数值算法喜欢正交矩阵?

只用结合律和 QᵀQ=I,就能证明长度不变;更一般地内积和距离也保持。

旋转的几何图像提醒 Strang 一个核心事实:QQ 乘上向量不会改变它的长度。与其直接操作平方根,不如先比较长度平方:

Qx22=(Qx)T(Qx)=xTQTQx=xTx=x22.\|Qx\|_2^2=(Qx)^{\mathsf T}(Qx)=x^{\mathsf T}Q^{\mathsf T}Qx=x^{\mathsf T}x=\|x\|_2^2.

这一步用的是矩阵乘法的结合律,不是交换律:可以移动括号,让中间的 QTQQ^{\mathsf T}Q 靠在一起;不能把任意两个矩阵交换位置。

教材习题进一步要求证明内积也不变:(Qx)T(Qy)=xTy(Qx)^{\mathsf T}(Qy)=x^{\mathsf T}y。于是非零向量间的夹角保持,且 QxQy=xy\|Qx-Qy\|=\|x-y\|。这些结论对列正交归一的高瘦 QQ 也成立,它可以把较低维输入等距嵌入较高维空间。

课堂说正交运算不会造成 overflow/underflow,强调它避免了变换不断放大或压小整体尺度。准确地说,精确数学中的二范数不增长;浮点中仍有舍入误差,中间求和和极端数据仍要合理实现,不能据此宣称任何代码都绝对不会溢出。

Strang 最后回到方阵的求解便利:Qx=bQx=b 直接给出 x=QTbx=Q^{\mathsf T}b。既保持几何,又容易求逆,正是后续分解算法反复采用 QQ 的原因。

核对与补充说明

字幕 05:40–09:34.33;21:50 帧左板保留完整保长推导,教材印刷29/PDF43 式 (3)、印刷35/PDF49 习题4。

带走这几点
  • 保长证明的关键操作是结合律。

  • 正交变换不会放大二范数意义下的绝对误差。

第二种二维例子:关于 θ/2 直线反射

把第二列换号仍然正交归一,但几何从旋转变成镜像,行列式变为 −1。

第二个二维家族是

F(θ)=[cosθsinθsinθcosθ].F(\theta)=\begin{bmatrix}\cos\theta&\sin\theta\\\sin\theta&-\cos\theta\end{bmatrix}.

列向量仍是单位且正交,所以 FTF=IF^{\mathsf T}F=I;但 detF=1\det F=-1,它不是旋转,而是反射。向量 (1,0)(1,0) 被送到角度 θ\theta 的方向,镜面位于角度 θ/2\theta/2 的直线上;垂直于镜面的方向被翻到另一侧。课堂通过 (0,1)(0,1) 的第二列追踪这一点。

旋转的行列式为 +1+1,反射为 1-1。两者都保持长度,区别在于是否改变定向。不要用“正交矩阵一定是旋转”替代完整分类。

可以补做两项代入辨认镜面:θ=0\theta=0F=diag(1,1)F=\operatorname{diag}(1,-1),镜面是横轴;θ=π/2\theta=\pi/2F=(0110)F=\begin{pmatrix}0&1\\1&0\end{pmatrix},它交换两个坐标,镜面是 y=xy=x。矩阵参数是 θ\theta,镜面方向是 θ/2\theta/2,这两个角不能混淆。

此外 F=FTF=F^{\mathsf T},再由正交性得到 F2=IF^2=I:反射两次回到原处。这个对称且正交的结构会在下一段推广到任意维数。

核对与补充说明

字幕 09:34.33–14:38.57;16:50 帧左板核对第二列负号和 θ/2 镜面;印刷33/PDF47 式 (12)、图1.8。

带走这几点
  • 反射保持长度,却翻转平面的定向。

  • 本例的镜面角度是 θ/2,不是 θ。

Householder:从秩一投影制造反射

H=I−2uuᵀ 既对称又正交,证明只需抓住中间的标量 uᵀu=1。

取单位列向量 uuuTu=1u^{\mathsf T}u=1),定义

H=I2uuT.H=I-2uu^{\mathsf T}.

uuTuu^{\mathsf T} 是到 uu 所张成直线的正交投影。于是对 uu 本身,Hu=u2u=uHu=u-2u=-u;若 wTu=0w^{\mathsf T}u=0,则 Hw=wHw=w。这正是关于 uu^\perp 超平面的镜像。

验证正交性时利用结合律和中间标量:

HTH=H2=(I2uuT)2=I4uuT+4u(uTu)uT=I.H^{\mathsf T}H=H^2=(I-2uu^{\mathsf T})^2=I-4uu^{\mathsf T}+4u(u^{\mathsf T}u)u^{\mathsf T}=I.

同时 HT=HH^{\mathsf T}=H,所以 Householder 矩阵既对称又正交,且 H1=HH^{-1}=H。教材给出的特征值是 1-1(沿 uu 一次)和 +1+1(在 uu^\perpn1n-1 次)。课堂称它比 Gram–Schmidt 更适合正交化;这是数值方法的预告,本讲没有比较算法或给出 QR 分解。

这里 uTuu^{\mathsf T}u 是标量,而 uuTuu^{\mathsf T}n×nn\times n 秩一矩阵。课堂 16:57 附近字幕把对称对象简写成“u transpose”,应读为外积 uuTuu^{\mathsf T}。若起点是任意非零向量 vv,补充通式为 H=I2vvT/(vTv)H=I-2vv^{\mathsf T}/(v^{\mathsf T}v)v=0v=0 时不能使用这个式子。

核对与补充说明

字幕 14:38.57–20:02.33;16:50 帧核对 H 定义,23:30 帧上板核对 H² 展开;印刷34/PDF48 式 (16)(17) 核对反射方向。

带走这几点
  • uᵀu 与 uuᵀ 的尺寸及含义不同。

  • 反射方向 u 翻转,其正交补全部固定。

Hadamard:用块矩阵递归构造正交列

H₂→H₄→H₈ 的 ±1 拼接保持列正交;每列仍要除以 √n 才归一。

Strang 在介绍 Hadamard 时穿插了数学家高龄仍讲课的故事,随后从最小的非平凡例子开始。为避免把板书中的归一化因子混进递归,这里约定 HnH_n 始终表示未归一化的 ±1\pm1 矩阵:

H2=(1111),H2n=(HnHnHnHn).H_2=\begin{pmatrix}1&1\\1&-1\end{pmatrix},\qquad H_{2n}=\begin{pmatrix}H_n&H_n\\H_n&-H_n\end{pmatrix}.

课堂明确写出

H4=(1111111111111111),H_4=\begin{pmatrix}1&1&1&1\\1&-1&1&-1\\1&1&-1&-1\\1&-1&-1&1\end{pmatrix},

再把四个 H4H_4 按同样正负号拼成 H8H_8。为什么奏效?若 HnTHn=nIH_n^{\mathsf T}H_n=nI,分块相乘便得到

H2nTH2n=(2nI002nI).H_{2n}^{\mathsf T}H_{2n}=\begin{pmatrix}2nI&0\\0&2nI\end{pmatrix}.

对角块是两次相加,非对角块因一正一负抵消。这补全了课堂对列内积的解释,也给出归纳证明。

但“列彼此正交”还不够叫正交矩阵:HnH_n 每列有 nn±1\pm1,长度为 n\sqrt n。故 Qn=Hn/nQ_n=H_n/\sqrt n 才有 QnTQn=IQ_n^{\mathsf T}Q_n=I。二维除以 2\sqrt2,四维除以 2,八维除以 8\sqrt8;这些正负模式可以用于编码等需要离散正交结构的场景。

核对与补充说明

完整字幕 20:02.33–23:59.55;23:30 帧核对 H₂、H₄、H₈;印刷30/PDF44 页图核对递归与归一化。

带走这几点
  • 块递归的交叉内积由正负号抵消。

  • 本文 Hₙ 未归一化,Qₙ=Hₙ/√n 才是正交矩阵。

离开二次幂:存在性不等于递归构造

H₁₂ 存在,但翻倍递归得不到它;课堂猜想要与已经证明的结构区别开。

翻倍能产生 2,4,8,16,2,4,8,16,\ldots 阶。Strang 接着问 12 阶呢?课堂指出 H12H_{12} 存在,但刚才的递归没有给出它。这促使大家猜:是不是任何偶数阶都能做?6 阶又不行。于是引出 Hadamard 猜想:每个正的 4 的倍数阶都存在 Hadamard 矩阵。

这段课是在讨论猜想,不能把它写成“块递归证明了全部 4 的倍数”。课堂与这版教材曾以 668 阶作为当时尚未构造出的例子;这里保留为录课/成书时期的叙述,没有核查或声称它是今天的研究进展。

校正边界: 字幕 24:54 说 1 阶也不行,但 [1][1] 显然满足条件,是平凡例外;2 阶也是例外。补充一个必要条件证明:对 n>2n>2 的 Hadamard 矩阵,变换行列符号及顺序,令第一行全 1,第二行前半 1、后半 −1。第三行与前两行均正交,使它在两个半段分别有同样多的 1 和 −1,所以 n/2n/2 还必须是偶数,即 4n4\mid n。这证明“必须”,没有证明“存在”。

两条奇数长度的 ±1\pm1 向量内积是奇数项 ±1\pm1 之和,不可能为 0,也能直接看出为什么 3 阶不行。

核对与补充说明

字幕 23:59.55–27:32.78;印刷30/PDF44 页图核对课堂时期的猜想与668叙述。必要条件证明与1阶校正为数学补充。

带走这几点
  • 2 的幂可由块递归构造;4 的倍数存在性是另一问题。

  • 区分必要条件、显式构造和未证明猜想。

Haar:把全局差分逐层压缩为局部差分

第一列描述平均,后续列描述越来越局部的差分;与 Hadamard 的区别在于尺度及零元素。

Strang 先提到“对称矩阵的特征向量会给出正交基”,又暂时回到一个直接可画出来的家族:Haar 小波。课堂依次画出常数、前半正后半负、左侧局部正负、右侧局部正负,并把它们装成列:

W4=(1110111011011101).W_4=\begin{pmatrix}1&1&1&0\\1&1&-1&0\\1&-1&0&1\\1&-1&0&-1\end{pmatrix}.

前两列长度为 2,后两列长度为 2\sqrt2。列两两正交:例如第二列与第三列内积 11=01-1=0;第三、第四列的非零位置互不重叠。它们目前是正交基,还没有单位化。

课堂接着构造八维版本。第一列八个 1,第二列四个 1 接四个 −1;接下来两列分别在左右半段放 (1,1,1,1)(1,1,-1,-1);最后四列把 (1,1)(1,-1) 分别放在四对相邻位置,其余全是 0。这就是“缩放”:相同正负模式越来越短,在不同位置重复。

把数据 xx 与这些列做内积,第一项取整体总和(除以相应尺度后关联平均),第二项比较前后半段总量,接下来的项比较更局部差异。作为补充计算,若 x=(2,2,0,0)x=(2,2,0,0),用归一化后的四列取内积得到 (2,2,0,0)(2,2,0,0):信号只需要整体常数与半段差分,两个局部差分系数为 0。正交基变换让结构集中到少量系数里。

Strang 用 Haar 与 Daubechies 的故事解释:最简单的小波只有 1、−1、0;寻找更平滑又保持有用正交性质的小波需要更多构造,课堂提到约 1988 年的进展。字幕中的“Adam R/Atomard”是 Hadamard,“Dovichy”是 Daubechies;本节的矩阵是 Haar,不要混为同一种变换。

核对与补充说明

字幕 27:32.78–34:48.69;29:20/33:00 帧核对四个阶梯形,42:30 帧核对 W₄/W₈,印刷35/PDF49 习题8核对 W₄。

带走这几点
  • Haar 的模式在缩短、移动;Hadamard 递归的列仍遍布全体位置。

  • 正交坐标把平均和不同尺度的差分分开。

从手工构造走向特征向量

实对称矩阵可选取实正交特征基;正交矩阵的特征基则可能必须进入复数域。

在具体例子之后,课堂回到一个系统来源:对称矩阵的特征向量。 实对称 S=STS=S^{\mathsf T} 有实特征值,并能选出完整的实正交归一特征基。下一讲将围绕它展开。

“特征向量自动正交”需要补全条件。若 Sx=λxSx=\lambda xSy=μySy=\mu yλμ\lambda\ne\mu,则

μxTy=xTSy=(Sx)Ty=λxTy,\mu x^{\mathsf T}y=x^{\mathsf T}Sy=(Sx)^{\mathsf T}y=\lambda x^{\mathsf T}y,

从而 xTy=0x^{\mathsf T}y=0。重特征值内任取两个向量不保证正交;可以在那个特征空间里重新选正交基。例如 S=IS=I 的所有非零向量都是特征向量,但 (1,0)(1,0)(1,1)(1,1) 并不正交。

课堂也说正交矩阵的特征向量是另一个来源。它们与实对称矩阵不同:即使矩阵全是实数,特征向量也可能要用复数,并用共轭内积来定义正交。下面的循环置换正好揭示这一点。本段的代数证明与反例为对课堂结论的补全。

核对与补充说明

字幕 34:48.69–36:07.45;35:20/38:30 帧核对对称与正交矩阵的来源说明;印刷35/PDF49 习题6后的结论。

带走这几点
  • 不同特征值保证相互正交;重根空间需选基。

  • 实正交矩阵的特征向量不一定全是实向量。

循环置换:频率基来自一个简单矩阵

只重排坐标的矩阵已经正交;一个四周期置换的特征向量给出 Fourier 模式。

离散 Fourier 变换不是把连续函数硬塞进矩阵,而是用一组离散频率向量作为基。Strang 把来源写得极简单:

P=(0100001000011000),P(x1,x2,x3,x4)T=(x2,x3,x4,x1)T.P=\begin{pmatrix}0&1&0&0\\0&0&1&0\\0&0&0&1\\1&0&0&0\end{pmatrix},\qquad P(x_1,x_2,x_3,x_4)^{\mathsf T}=(x_2,x_3,x_4,x_1)^{\mathsf T}.

它把单位阵的四列重新排序,所以 PTP=IP^{\mathsf T}P=I;逆矩阵是反向循环移动,恰好等于 PTP^{\mathsf T}一般置换矩阵都正交,但这里特定的四周期置换才给出下面这套四点 Fourier 特征向量;不能把所有置换的谱都当成同一组频率。

课堂强调信号处理喜欢先用 Fourier 变换看信号:将数据拆成频率成分,往往比直接盯着原坐标更有解释力。FFT 是快速计算这类变换的算法,此处只作动机介绍。

虽然 PP 的条目只有 0、1,它的特征向量仍需要复数。实对称矩阵可以选择实特征基,这个正交矩阵则有 ±i\pm i 特征值。不要把“矩阵实”误认为“所有特征值、特征向量也都实”。在写出 Fourier 矩阵之前,课堂回顾了旋转、反射、Householder、小波这几类例子。

核对与补充说明

字幕 36:07.45–41:11.11;38:30 帧明确核对 P 的循环方向,印刷35/PDF49 习题6同一矩阵。

带走这几点
  • 置换保持内积,来自标准基列的重排。

  • 循环平移的特征向量就是保持形状、仅改变相位的频率模式。

学生追问:Haar 每一列应除以哪个长度?

八维 Haar 的列长有 √8、2、√2 三档,不能统一除以 √8。

一位学生在此提醒:黑板上的 Haar 列还没有单位化。Strang 起初说除以 8\sqrt8,马上在追问下修正——不同尺度的列有不同长度。

八维的常数列和全局差分列各有八个非零条目,长度 8\sqrt8;两列半段差分各有四个非零条目,长度 22;四列相邻差分各有两个非零条目,长度 2\sqrt2。因此

W8TW8=diag(8,8,4,4,2,2,2,2).W_8^{\mathsf T}W_8=\operatorname{diag}(8,8,4,4,2,2,2,2).

D=diag(8,8,2,2,2,2,2,2)D=\operatorname{diag}(\sqrt8,\sqrt8,2,2,\sqrt2,\sqrt2,\sqrt2,\sqrt2),正确的正交矩阵是 QW=W8D1Q_W=W_8D^{-1}:在右边乘对角阵,逐列缩放。课堂问答提醒我们,Hadamard 可统一除以 n\sqrt n,Haar 必须按列处理。

核对与补充说明

字幕 41:11.11–41:44.85;42:30 帧保留 √8、√4、√2 的板书修正,W₄ 模式由印刷35/PDF49 核对。

带走这几点
  • Haar 的不同支撑长度产生不同列范数。

  • 右乘对角阵缩放列,得到 QᵀQ=I。

四个 Fourier 向量:从全 1 到复指数

循环平移不改变常数向量;其余特征向量由 i 的幂组成,对应四种离散频率。

教师先问:“哪个向量无论怎样置换都不变?”答案是全 1 向量。这是零频率的 Fourier 向量,特征值为 1。随后写出

fk=(1,ik,i2k,i3k)T,k=0,1,2,3,i2=1,f_k=(1,i^k,i^{2k},i^{3k})^{\mathsf T},\quad k=0,1,2,3,\qquad i^2=-1,

组成

F4=(11111i1i11111i1i).F_4=\begin{pmatrix}1&1&1&1\\1&i&-1&-i\\1&-1&1&-1\\1&-i&-1&i\end{pmatrix}.

在课堂确定的循环方向下,直接左移坐标可见

Pfk=(ik,i2k,i3k,1)T=ikfk,Pf_k=(i^k,i^{2k},i^{3k},1)^{\mathsf T}=i^k f_k,

最后一项成立是因为 i4k=1i^{4k}=1。四个特征值依次为 1,i,1,i1,i,-1,-i;如果把置换方向反过来,特征值相应取逆,不能忽略方向。

课堂穿插了数学写 ii、电工常写 jj 的小玩笑;它们都表示平方为 1-1 的虚数单位。这里统一用 ii。每列的复范数平方为 4,所以归一化 Fourier 矩阵为 UF=F4/2U_F=F_4/2。接下来必须把“内积”也正确推广到复数,才能证明 UFUF=IU_F^*U_F=I

核对与补充说明

字幕 41:44.85–44:41.29;44:30 帧核对 F₄ 幂次,38:30 帧核对 P;印刷35/PDF49 习题7交叉核对。逐列特征值计算是补全课堂验证。

带走这几点
  • F₄ 的各列是循环移动的特征向量。

  • 除以 2 是单位化;进入复数后需要共轭转置。

忘记共轭:课堂中实际发生的错误

第0列与第1列看似用普通点积也能过关;第1列与第3列会暴露错误。

先看 f0=(1,1,1,1)Tf_0=(1,1,1,1)^{\mathsf T}f1=(1,i,1,i)Tf_1=(1,i,-1,-i)^{\mathsf T}1+i1i=01+i-1-i=0,看起来普通转置就能检查正交。但这是因为第一列全是实数,取共轭没有改变它。

课堂故意用第1频率列与第3频率列检验错误方法。设 f3=(1,i,1,i)Tf_3=(1,-i,-1,i)^{\mathsf T},不取共轭时

f1Tf3=1+i(i)+(1)(1)+(i)i=4.f_1^{\mathsf T}f_3=1+i(-i)+(-1)(-1)+(-i)i=4.

正确地对第一列取共轭后,

f1f3=1+(i)(i)+(1)(1)+i2=11+11=0.f_1^*f_3=1+(-i)(-i)+(-1)(-1)+i^2=1-1+1-1=0.

复内积定义为 xy=xTyx^*y=\overline{x}^{\mathsf T}y,相应长度为 x2=xx=jxj2\|x\|^2=x^*x=\sum_j|x_j|^2。例如非零向量 f1f_1f1Tf1=0f_1^{\mathsf T}f_1=0,但 f1f1=4f_1^*f_1=4;这也解释了为什么普通转置不能定义复长度。

补充统一证明:fjfk=r=03ir(kj)f_j^*f_k=\sum_{r=0}^3 i^{r(k-j)}j=kj=k 时四项都为1;jkj\ne k 时等比级数和为0。因此 F4F4=4IF_4^*F_4=4IUF=F4/2U_F=F_4/2 满足 UFUF=IU_F^*U_F=I,称为酉矩阵(复数版本的正交矩阵)。

字幕 47:16 后对“负号、平方、共轭”的口语有混乱;共轭只将 ii 换成 i-i,实数 1-1 本身不变,以上明确列出每项避免误读。

核对与补充说明

字幕 44:41.29–47:41.63;47:30/48:40 帧核对 Fourier 列与 conjugate 提醒;印刷29/PDF43 复内积定义、印刷35/PDF49 习题7的共轭转置。

带走这几点
  • 在复向量中,长度与正交都必须使用共轭内积。

  • 第0列恰好全实,会掩盖忘记共轭的错误。

结尾命题:不同特征值的特征向量正交

正交矩阵保持复内积;其特征值模为1,从而不同特征值的特征向量共轭正交。

课堂最后写下 QTQ=IQ^{\mathsf T}Q=IQx=λxQx=\lambda xQy=μyQy=\mu y,并强调 λμ\lambda\ne\mu。想得到的结论是 xy=0x^*y=0。老师说明可从这些式子推出,但没有把全部代数写完;下面是补全证明

首先 x0x\ne0,保长性给出 Qx=x\|Qx\|=\|x\|,而 λx=λx\|\lambda x\|=|\lambda|\|x\|,所以 λ=1|\lambda|=1,同理 μ=1|\mu|=1。实正交矩阵在复数域仍有 QQ=QTQ=IQ^*Q=Q^{\mathsf T}Q=I,因此

xy=(Qx)(Qy)=λμxy.x^*y=(Qx)^*(Qy)=\overline\lambda\mu\,x^*y.

λμ=1\overline\lambda\mu=1,由于 λ=1|\lambda|=1 就有 μ=λ\mu=\lambda,与条件矛盾。因此 xy=0x^*y=0。对重复特征值,任取两条特征向量未必正交,应在特征空间内选择正交基。

这样本讲有了统一认识:旋转、反射、Hadamard、Haar 以不同方式制造正交列;循环置换的 Fourier 特征向量则预告了一种更系统的来源。正交基让我们用内积直接提取坐标,并在变换时保持长度。继续到第4讲,把特征方程、相似对角化和实对称矩阵的谱分解连接起来。

核对与补充说明

字幕 47:41.63–49:22.51;48:40 帧核对结尾命题,印刷35/PDF49 核对特征向量来源;模长和内积代数为明确标注的补充证明。

带走这几点
  • 实正交矩阵特征值位于复平面的单位圆上。

  • 不同特征值的特征向量共轭正交,完整证明还需要单位模条件。

CLOSE THE LOOP

合上讲义,还能讲清楚吗?

用几道问题,检查你是否掌握了这一讲的关键区别。

概念索引 · 中英术语对照
正交归一列 orthonormal columns

列向量两两内积为 0 且各自长度为 1。

正交矩阵 orthogonal matrix

方阵 Q 满足 QᵀQ=QQᵀ=I,故 Q⁻¹=Qᵀ。

Householder 矩阵 Householder matrix

H=I−2uuᵀ(uᵀu=1),关于 u⊥ 反射的对称正交矩阵。

Hadamard 矩阵 Hadamard matrix

由 ±1 构成且 HᵀH=nI 的矩阵;除以 √n 后列正交归一。

Haar 小波 Haar wavelet

用 1、−1、0 表示分层平均与局部差分的稀疏正交基。

置换矩阵 permutation matrix

重排单位阵列的方阵,列正交归一且逆等于转置。

共轭转置 conjugate transpose

复矩阵先取共轭再转置,记作 A*;用于复内积。

Fourier 基 Fourier basis

按离散频率组织的复指数向量,构成信号分解的正交坐标。

学习整理 · 原课:MIT OpenCourseWare / Gilbert Strang · 教材:Linear Algebra and Learning from Data