线性代数应该这样学 · 互动教材
INTERACTIVE TEXTBOOK · 互动教材

线性代数应该这样学 · 互动教材

Axler 的线性代数以「线性映射」为主线、把行列式放到最后。这份中文互动教材把原书每一个重要的定义与定理讲成「直觉 + 图形 + 可动手的演示」,证明折叠备查,保留原书编号与英文术语,方便随时对照英文原书。

内容整理自 Sheldon Axler, Linear Algebra Done Right, 4th ed., Springer (UTM), 2024(开放获取,CC BY-NC 4.0)。灰色小标签为原书编号。

怎么用这本互动教材
  • 左侧目录切换章节;进入章节后可展开小节快速跳转。左上角搜索框可搜索小节标题和术语。
  • 每章开头的「⚡ 一分钟速览」和「🗺 本章地图」先帮你建立全局印象,再逐节深入。
  • 带 ⚙ 标记的是交互演示:拖动图中的点、滑块或点击按钮,观察图形与数值如何变化;「👀 观察」提示告诉你该注意什么。
  • 灰色小标签(如 3.21)是原书编号,方便对照英文原书;术语首次出现附英文。
  • 证明与推导默认折叠,想深究时再展开;点击术语卡片可翻面;测验题选择后立即给出解释。
  • 右上角 ☾/☀ 切换明暗主题;已读章节会在目录中标记。
作者最看重的十个结论 The author's top ten

Axler 在「给教师的序言」中列出的十个最重要的结果——真正理解了它们,就打下了扎实的线性代数基础。

  1. 向量空间的任意两组基长度相同 2.34
  2. 线性映射基本定理 3.21
  3. 𝐅 = ℂ 时特征值一定存在 5.19
  4. 𝐅 = ℂ 时总有上三角矩阵 5.47
  5. Cauchy–Schwarz 不等式 6.14
  6. Gram–Schmidt 正交化 6.32
  7. 谱定理 7.297.31
  8. 奇异值分解 7.70
  9. 𝐅 = ℂ 时的广义特征空间分解 8.22
  10. dim V = n 时交错 n-线性型空间的维数为 1 9.37
学习路线建议
时间有限时按原书建议:第 4 章快速浏览(只需记住结论);3E 商空间、5E 可交换算子、6C 中的伪逆可先跳过;3F 对偶只有在学 9D 张量积时才需要。
主线1 → 2 → 3 → 5 → 6 → 7:从向量空间到谱定理与 SVD,是全书的骨架。
进阶8(复空间上算子的完整结构:广义特征空间、Jordan 形)与 9(行列式的无坐标定义、张量积)。

目录

第 1 章
向量空间
Vector Spaces
复数、ℝⁿ 与 ℂⁿ、向量空间的公理化定义、子空间、子空间的和与直和
第 2 章
有限维向量空间
Finite-Dimensional Vector Spaces
线性组合与张成、线性无关、基、维数——有限维空间的骨架
第 3 章
线性映射
Linear Maps
线性映射、零空间与值域、线性映射基本定理、矩阵、可逆与同构、基变换、积与商空间、对偶
第 4 章
多项式
Polynomials
复数的共轭与绝对值、多项式的零点、带余除法、代数基本定理与 ℂ/ℝ 上的因式分解
第 5 章
特征值与特征向量
Eigenvalues and Eigenvectors
不变子空间、特征值、极小多项式、上三角矩阵、可对角化、Gershgorin 圆盘、可交换算子
第 6 章
内积空间
Inner Product Spaces
内积与范数、Cauchy–Schwarz 与三角不等式、规范正交基、Gram–Schmidt、Riesz 表示、正交补、最小化问题与伪逆
第 7 章
内积空间上的算子
Operators on Inner Product Spaces
伴随、自伴与正规算子、谱定理、正算子、等距与酉算子、QR 与 Cholesky 分解、奇异值分解及其推论
第 8 章
复向量空间上的算子
Operators on Complex Vector Spaces
算子幂的零空间、广义特征向量、幂零算子、广义特征空间分解、重数、分块对角矩阵、平方根、Jordan 标准形、迹
第 9 章
多重线性代数与行列式
Multilinear Algebra and Determinants
双线性型与二次型、交错多重线性型与置换、行列式的无坐标定义与性质、张量积
第 1 章

向量空间 Vector Spaces

线性代数研究「有限维向量空间上的线性映射」。这一章先把舞台搭好:数从哪里来(ℝ 与 ℂ)、什么叫向量空间、空间里的「子空间」怎样相加——一切都只建立在两种运算上:加法与数乘。

学习目标
  • 把复数看成平面上的点:加法 = 平行四边形,乘法 = 旋转 + 伸缩;知道 𝐅 代表 ℝ 或 ℂ。
  • 理解 𝐅ⁿ(长度为 n 的组)以及「按坐标」的加法与数乘,并能在 ℝ² 中画出来。
  • 掌握向量空间的定义(加法与数乘满足一组运算规律),能判断一个「集合 + 运算」是不是向量空间;认识数列空间 𝐅∞、函数空间 𝐅S 这类「元素不是箭头」的向量空间。
  • 会用三条件(含 0、加法封闭、数乘封闭)判定子空间,并能举出反例。
  • 理解子空间的和 U + W 与直和 U ⊕ W:直和就是「分解唯一」,对两个子空间等价于 U ∩ W = {0}。
一分钟速览
  • 复数 $a+bi$ 就是平面上的点 $(a,b)$:相加 = 平行四边形法则;相乘 = 长度相乘、角度相加(乘以 $i$ 就是逆时针转 90°,所以 $i^2=-1$)。
  • 𝐅ⁿ 是长度为 n 的数组;加法与数乘都「按坐标逐个做」。n ≥ 4 时画不出来,但代数照算不误——这就是「线性代数」名字的由来。
  • 向量空间 = 集合 + 加法 + 数乘,且满足熟悉的运算规律:交换、结合、有零向量、有负向量、$1v=v$、两条分配律。
  • 「向量」不一定是箭头:数列、函数也都是向量——它们的加法和数乘是「逐点」进行的。
  • 只用这些公理就能推出:零向量唯一、负向量唯一、$0v=0$、$a0=0$、$(-1)v=-v$。
  • 子空间 = 含 0、对加法和数乘都封闭的子集;ℝ² 的子空间只有 {0}、过原点的直线、ℝ² 本身。
  • U + W 是包含 U 和 W 的最小子空间;若每个向量写成 $u+w$ 的方式唯一,就叫直和 U ⊕ W。两个子空间时:直和 ⇔ U ∩ W = {0};三个以上时「两两只交于 0」并不够。
本章地图 1A ℝⁿ 与 ℂⁿ 1B 向量空间的定义 1C 子空间 复数 ℂ乘法 = 旋转 + 伸缩 标量 𝐅 = ℝ 或 ℂ都是「域」 组与 𝐅ⁿ按坐标加法与数乘 向量空间的定义加法 + 数乘 + 运算规律 例子:𝐅ⁿ、数列、函数函数也是向量 由公理推出的性质0 与 −v 唯一,0v = 0 子空间含 0 + 两种封闭 子空间的和 U + W包含它们的最小子空间 直和 U ⊕ W分解唯一 ⇔ U ∩ W = {0} → 第 2 章:张成、线性无关、基与维数(届时才能证明 ℝ² 的子空间只有那三类)

线性代数研究的是有限维向量空间上的线性映射(linear maps on finite-dimensional vector spaces)。这些词要到后面几章才全部讲清;这一章只做一件事:把「向量空间」定义出来,并认识它最基本的性质。

Axler 从一开始就把复数和实数放在一起讲——因为同时考虑复数时,定理更漂亮、洞察更多(例如第 5 章会看到:有限维非零复向量空间上的每个算子都有特征值,实向量空间上就不一定——比如平面上的旋转)。本章的路线是:平面与空间 → ℝⁿ 和 ℂⁿ → 抽象的向量空间 → 子空间 → 子空间的和与直和。原书开篇插图是笛卡尔向瑞典女王讲解他的工作:向量空间正是笛卡尔 1637 年「用两个坐标描述平面」这一想法的推广。

集合论里的概念向量空间里的类比一句话
子集 subset子空间 subspace大空间里自成一体的小空间(1C)
并集 union和 sum包含两者的最小对象(1.40)
不交并 disjoint union直和 direct sum「不相交」换成「只在 0 处相交」(1.46)

1A ℝⁿ 与 ℂⁿ Rⁿ and Cⁿ

这一节要回答两个问题:我们用来做乘法的数(标量)从哪里来?最朴素的向量长什么样?答案是:数取自实数 ℝ 或复数 ℂ(统称 𝐅);最朴素的向量是 𝐅ⁿ 中由 n 个数排成的「组」,它们按坐标相加、按坐标数乘。

复数 Complex Numbers

你已经熟悉实数集 ℝ。复数的发明是为了让负数也能开平方:假设有一个数 $i$,它是 $-1$ 的平方根,并且服从通常的算术规则。

直觉:复数就是平面上的点

把 $a+bi$ 画成平面上的点 $(a,b)$(这张平面叫复平面(complex plane),横轴是实部、纵轴是虚部)。于是:

  • 加法就是把两个箭头头尾相接——平行四边形法则;
  • 乘法是「长度相乘、角度相加」:$i$ 的长度是 1、角度是 90°,所以乘以 $i$ 就是逆时针转 90°;转两次就是转 180°,也就是乘以 $-1$。这正是 $i^2=-1$ 的几何含义。
定义复数、ℂcomplex numbers, C1.1
  • 复数(complex number)是一个有序对 $(a,b)$,其中 $a,b\in\mathbf{R}$;我们把它写成 $a+bi$。
  • 全体复数组成的集合记作 $\mathbf{C}=\{a+bi: a,b\in\mathbf{R}\}$。
  • ℂ 上的加法与乘法定义为($a,b,c,d\in\mathbf{R}$):
$$(a+bi)+(c+di)=(a+c)+(b+d)i,\qquad (a+bi)(c+di)=(ac-bd)+(ad+bc)i.$$

把 $a+0i$ 等同于实数 $a$,于是 ℝ 可以看成 ℂ 的子集;$0+bi$ 简写为 $bi$,$0+1i$ 简写为 $i$。

乘法公式不用背

Axler 特意提醒:只要记住 $i^2=-1$,再按通常的分配律、交换律展开,就能随时重新推出乘法公式;反过来,用这个公式也能验证 $i\cdot i=(0\cdot0-1\cdot1)+(0\cdot1+1\cdot0)i=-1$。(页边注:符号 $i$ 由欧拉在 1777 年首先用来表示 $\sqrt{-1}$。)

例复数运算complex arithmetic1.2

用分配律与交换律展开即可:$(2+3i)(4+5i)=8+10i+12i+15i^2=8+22i-15=-7+22i$。

下面的演示把「长度相乘、角度相加」变成可以拖动的图。注意两块浅色三角形:$(0,1,z)$ 与 $(0,w,zw)$ 形状完全相同——后者正是前者绕原点转过 $w$ 的角度、再放大 $|w|$ 倍得到的。这就是复数乘法的几何本质。

复平面:拖动 z 与 w,看 z + w 与 z·w

拖动蓝点 z 与红点 w(吸附到 0.25 的格点,长度不超过 2)。绿色箭头是 $z+w$,紫色箭头是 $zw$;原点附近两段圆弧首尾相接,分别是 $z$ 与 $w$ 的角度。点「令 z = 1,w = …」一行的按钮,再连按「z ← z·w」,看 $w$ 的各次幂怎样绕圈。

zwz + wz·w
令 z = 1,w =

不管怎么拖,$|zw|$ 总等于 $|z|\cdot|w|$,$zw$ 的角度总等于两个角度之和。$w=i$ 时连按:$1\to i\to -1\to -i\to 1$,第二步就是 $i^2=-1$;$w=\frac{-1+\sqrt3 i}{2}$(长度 1、角度 120°)时按三次回到 1——它是 1 的立方根(习题 1A.7);$w=\frac{1+i}{\sqrt2}$(角度 45°)时按两次得到 $i$——它是 $i$ 的平方根(习题 1A.8);$w=2$ 时只伸长不转动。

我们期望复数加法与乘法具有熟悉的运算规律,下面的结果确认了这一点。

定理复数运算的性质properties of complex arithmetic1.3
性质内容(对所有 α, β, λ ∈ ℂ)
交换律 commutativity$\alpha+\beta=\beta+\alpha$,$\alpha\beta=\beta\alpha$
结合律 associativity$(\alpha+\beta)+\lambda=\alpha+(\beta+\lambda)$,$(\alpha\beta)\lambda=\alpha(\beta\lambda)$
单位元 identities$\lambda+0=\lambda$,$\lambda1=\lambda$
加法逆元 additive inverse对每个 $\alpha$,存在唯一的 $\beta$ 使 $\alpha+\beta=0$
乘法逆元 multiplicative inverse对每个 $\alpha\neq0$,存在唯一的 $\beta$ 使 $\alpha\beta=1$
分配律 distributive property$\lambda(\alpha+\beta)=\lambda\alpha+\lambda\beta$

一句话:复数和实数一样「好算」。每条性质都是用实数的相应性质加上 1.1 的定义直接验证的(其余几条留作习题 1A.1–1A.6)。

以乘法交换律为例(原书例 1.4)

设 $\alpha=a+bi$,$\beta=c+di$($a,b,c,d\in\mathbf{R}$)。按定义,$\alpha\beta=(ac-bd)+(ad+bc)i$,而 $\beta\alpha=(ca-db)+(cb+da)i$。由于实数的乘法与加法可交换,两式的实部、虚部分别相等,所以 $\alpha\beta=\beta\alpha$。1.4

有了加法逆元与乘法逆元,就可以定义减法与除法。

定义−α、减法、1/α、除法−α, subtraction, 1/α, division1.5

设 $\alpha,\beta\in\mathbf{C}$。

  • $-\alpha$ 表示 $\alpha$ 的加法逆元,即唯一满足 $\alpha+(-\alpha)=0$ 的复数;减法(subtraction)定义为 $\beta-\alpha=\beta+(-\alpha)$。
  • 当 $\alpha\neq0$ 时,$1/\alpha$(也写作 $\frac{1}{\alpha}$)表示 $\alpha$ 的乘法逆元,即唯一满足 $\alpha(1/\alpha)=1$ 的复数;除法(division)定义为 $\beta/\alpha=\beta(1/\alpha)$。
实际怎么算 1/(a+bi)?(补充)

分子分母同乘 $a-bi$:$\dfrac{1}{a+bi}=\dfrac{a-bi}{a^2+b^2}$。几何上:长度取倒数、角度取相反数——正好把「长度相乘、角度相加」撤销掉。($a-bi$ 叫共轭复数,原书在第 4 章才正式引入。)

为了让同一个定义、同一个定理同时适用于实数和复数,引入下面的记号。

定义记号 𝐅notation: F1.6

全书中,$\mathbf{F}$ 表示 $\mathbf{R}$ 或 $\mathbf{C}$。

所以凡是对 𝐅 证明的定理,把 𝐅 换成 ℝ 或换成 ℂ 都成立。用字母 F 是因为 ℝ 与 ℂ 都是所谓的域(field)(本节末的题外话会讲)。𝐅 中的元素叫做标量(scalar)——这只是「数」的一个正式说法,用来强调它是个数、而不是向量。对 $\alpha\in\mathbf{F}$ 和正整数 $m$,$\alpha^m$ 表示 $m$ 个 $\alpha$ 连乘,于是 $(\alpha^m)^n=\alpha^{mn}$,$(\alpha\beta)^m=\alpha^m\beta^m$。

在复平面上,把复数 z 乘以 i 相当于做什么?

组 Lists

在定义 ℝⁿ 与 ℂⁿ 之前,先看两个熟悉的例子,再引入「组」这个概念,把 2 维、3 维推广到任意维。

例ℝ² 与 ℝ³R² and R³1.7

ℝ²(可以想成一张平面)是全体有序实数对的集合:$\mathbf{R}^2=\{(x,y):x,y\in\mathbf{R}\}$。ℝ³(可以想成我们生活的空间)是全体有序实数三元组的集合:$\mathbf{R}^3=\{(x,y,z):x,y,z\in\mathbf{R}\}$。

定义组、长度list, length1.8
  • 设 $n$ 是非负整数。长度为 $n$ 的组(list)是由 $n$ 个元素排成的有序序列(元素可以是数、别的组,或更抽象的对象)。$n$ 叫它的长度(length)。
  • 两个组相等,当且仅当它们长度相同,并且对应位置上的元素相同。

组通常写成用逗号隔开、用圆括号括起来的样子:长度为 2 的组是有序对 $(a,b)$,长度为 3 的组是有序三元组 $(x,y,z)$,长度为 $n$ 的组形如 $(z_1,\dots,z_n)$。很多数学家把长度为 $n$ 的组叫做 n 元组(n-tuple)。两个细节:

  • 按定义,每个组的长度都是有限的非负整数。像 $(x_1,x_2,\dots)$ 这样「无限长」的东西不是组(它是数列,1B 节会用到)。
  • 长度为 0 的组也算组,写作 $(\ )$。这样规定是为了让后面的一些定理不必出现平凡的例外。
例组与集合的区别lists versus sets1.9
组 list有限集合 set
顺序有关:$(3,5)\neq(5,3)$无关:$\{3,5\}=\{5,3\}$
重复有意义:$(4,4)\neq(4,4,4)$(长度不同)无意义:$\{4,4\}=\{4,4,4\}=\{4\}$

关于 (4, 4) 与 (4, 4, 4),下面哪个说法正确?

𝐅ⁿ Fⁿ

要定义 ℝ² 与 ℝ³ 的高维类比,只需把 ℝ 换成 𝐅(ℝ 或 ℂ),把 2 或 3 换成任意正整数 n。

定义𝐅ⁿ、坐标Fⁿ, coordinate1.11

(记号 1.10:本章固定一个正整数 $n$。)$\mathbf{F}^n$ 是由 𝐅 中元素组成的、长度为 $n$ 的全体组的集合:

$$\mathbf{F}^n=\{(x_1,\dots,x_n): x_k\in\mathbf{F},\ k=1,\dots,n\}.$$

对 $(x_1,\dots,x_n)\in\mathbf{F}^n$,称 $x_k$ 为它的第 $k$ 个坐标(coordinate)。当 $\mathbf{F}=\mathbf{R}$、$n=2$ 或 $3$ 时,这正是前面的 ℝ² 与 ℝ³。

例ℂ⁴C⁴1.12

ℂ⁴ 是全体由 4 个复数组成的组:$\mathbf{C}^4=\{(z_1,z_2,z_3,z_4): z_1,z_2,z_3,z_4\in\mathbf{C}\}$。

画不出来,但算得出来

$n\ge4$ 时,我们无法把 ℝⁿ 想象成一个物理对象;ℂ¹ 还能看成一张平面,但 $n\ge2$ 时人脑就无法完整想象 ℂⁿ 了(ℂ² 相当于 4 个实数维度)。然而即使 $n$ 很大,在 𝐅ⁿ 中做代数运算仍然和在 ℝ²、ℝ³ 中一样容易。原书页边注说:经济学模型可能有 5000 个变量 $x_1,\dots,x_{5000}$,只能在 $\mathbf{R}^{5000}$ 中工作——几何手段无能为力,代数方法却很好用,所以这门学科叫线性代数。(Axler 还推荐了 1884 年的小说《平面国》Flatland:看生活在 ℝ² 里的生物如何感知 ℝ³,有助于想象四维以上的空间。)

例如 𝐅ⁿ 中的加法定义如下——就是「对应坐标相加」。

定义𝐅ⁿ 中的加法addition in Fⁿ1.13
$$(x_1,\dots,x_n)+(y_1,\dots,y_n)=(x_1+y_1,\dots,x_n+y_n).$$

数学上常用一个字母表示整个组,而不把坐标写出来,这样更简洁。比如下面的结果就直接用 $x,y\in\mathbf{F}^n$ 来叙述(证明时才需要写出坐标)。Axler 的建议是:能只用 $x$ 就只用 $x$,尽量避免显式写坐标。

定理𝐅ⁿ 中加法的交换律commutativity of addition in Fⁿ1.14

若 $x,y\in\mathbf{F}^n$,则 $x+y=y+x$。

证明

核心想法:把问题「逐个坐标」地归结为数的交换律。设 $x=(x_1,\dots,x_n)$,$y=(y_1,\dots,y_n)$,则

$x+y=(x_1+y_1,\dots,x_n+y_n)=(y_1+x_1,\dots,y_n+x_n)=y+x$。

第一、三个等号用的是 𝐅ⁿ 中加法的定义,中间的等号用的是 𝐅 中加法的交换律。∎

定义记号 0notation: 01.15

用 $0$ 表示所有坐标都为 0 的长度为 $n$ 的组:$0=(0,\dots,0)$。

这里符号 0 用了两种意思:等号左边的 0 是 𝐅ⁿ 中的一个组,右边的每个 0 是数。这看似容易混淆,其实不会出问题——上下文总能说明是哪一个。例如 1.16 说「对所有 $x\in\mathbf{F}^n$,$x+0=x$」,这里的 0 只能是组 $(0,\dots,0)$,因为我们根本没有定义「组 + 数」。

几何图像。ℝ² 可以画在纸上或屏幕上,所以我们用它来帮助直觉。ℝ² 的典型元素是一个点 $v=(a,b)$;有时我们不把 $v$ 看成点,而看成从原点出发、到 $(a,b)$ 结束的箭头,这时称它为向量(vector)。把箭头平行移动(长度、方向都不变),我们仍把它看成同一个向量——因此常常可以丢开坐标轴,只想「箭头本身」。

v (a, b) 点,也是箭头 v v 平移后仍是同一向量 u v u + v 加法:头尾相接 x −x 加法逆元:反向 x ½x −³⁄₂x 数乘:伸缩或反向
重画原书第 8–9 页的五幅小图:ℝ² 的元素可以看成点或箭头;平行移动的箭头代表同一向量;两向量之和;向量与它的加法逆元;数乘 $x$、$\tfrac12x$、$-\tfrac32x$。

加法的几何意义。要把 ℝ² 中的 $u$ 与 $v$ 相加,就把 $v$ 平移,使它的起点落在 $u$ 的终点;从 $u$ 的起点指向 $v$ 的终点的箭头就是 $u+v$。在坐标里,这恰好是 1.13 的「对应坐标相加」。

定义𝐅ⁿ 中的加法逆元additive inverse in Fⁿ, −x1.17

对 $x\in\mathbf{F}^n$,$x$ 的加法逆元(additive inverse)记作 $-x$,是满足 $x+(-x)=0$ 的向量。于是若 $x=(x_1,\dots,x_n)$,则 $-x=(-x_1,\dots,-x_n)$。在 ℝ² 中,$-x$ 与 $x$ 长度相同、方向相反。

加法讲完了,再看乘法。我们可以模仿加法,把两个向量「对应坐标相乘」得到一个新向量——但经验表明这种乘法对我们的目的没什么用。真正的主角是另一种乘法:数 × 向量。

定义𝐅ⁿ 中的数乘scalar multiplication in Fⁿ1.18

数 $\lambda\in\mathbf{F}$ 与向量 $(x_1,\dots,x_n)\in\mathbf{F}^n$ 的乘积,就是把每个坐标都乘以 $\lambda$:

$$\lambda(x_1,\dots,x_n)=(\lambda x_1,\dots,\lambda x_n).$$

数乘的几何意义(ℝ²):$\lambda\gt0$ 时,$\lambda x$ 与 $x$ 同向、长度是 $x$ 的 $\lambda$ 倍($\lambda\lt1$ 缩短,$\lambda\gt1$ 伸长);$\lambda\lt0$ 时方向相反、长度是 $|\lambda|$ 倍。注意区分:数乘(scalar multiplication)是「数 × 向量 = 向量」;而 ℝ²、ℝ³ 中的点积是「向量 × 向量 = 数」,它的推广要到第 6 章(内积)才登场。

ℝ² 中的向量加法与数乘

拖动蓝色箭头 u 与红色箭头 v 的尖端(吸附到 0.5 的格点)。绿色是 $u+v$,两条虚线路径「先 u 后 v」「先 v 后 u」围成平行四边形。拖 λ 滑块看紫色的 $\lambda u$;按「扫描 λ」让 λ 自动来回变化。

几何上的「头尾相接」与坐标上的「对应坐标相加」说的是同一件事。「先 u 后 v」和「先 v 后 u」到达同一点——这就是交换律 1.14 的图像。扫描 λ 时,$\lambda u$ 始终在过原点、沿 $u$ 方向的直线上滑动:λ > 0 同向,λ < 0 反向,λ = 0 时缩成零向量。所有 $\lambda u$ 恰好铺满这条直线——1C 节会看到,它是一个子空间。

图只是拐杖

在 ℝ² 中画图、说「点」「箭头」,都只是帮助理解的工具,不能代替我们要建立的数学。高维空间画不出好图,但其中的元素和 ℝ² 的元素一样被严格定义。例如 $(2,-3,17,\pi,\sqrt2)$ 是 ℝ⁵ 的元素,我们可以随口叫它 ℝ⁵ 中的「点」或「向量」,而不必操心 ℝ⁵ 的几何有没有物理意义。

关于域的题外话 Digression on Fields

直觉

域就是一个能做加、减、乘、除(除数非零)的数系,而且运算规律和 ℝ、ℂ 完全一样。

严格地说,域(field)是一个至少含两个不同元素 0 和 1 的集合,配上加法和乘法,满足 1.3 列出的全部性质。所以 ℝ、ℂ 都是域;有理数集 ℚ(配通常的加法与乘法)也是域。一个更奇特的例子是只有两个元素的集合 {0, 1}:加法与乘法照常,只是规定 $1+1=0$(可以把 0、1 想成「偶数」「奇数」)。反例:整数集 ℤ 不是域,因为 2 没有乘法逆元($\tfrac12\notin\mathbf{Z}$)。

二元域的加法(注意 1 + 1 = 0)
+01
001
110
二元域的乘法(与通常相同)
×01
000
101

本书只使用 ℝ 与 ℂ 这两个域。不过线性代数中许多定义、定理与证明,对 ℝ、ℂ 成立,对任意域也原样成立。愿意的话,除了讨论内积空间的第 6、7 章之外,你都可以把 𝐅 想成任意一个域。对于以「𝐅 = ℂ」为前提的结果(内积各章除外),通常可以把这个前提换成「𝐅 是代数闭域(algebraically closed field)」——即每个非常数多项式都有零点(ℂ 是,ℝ 不是:$x^2+1$ 在 ℝ 中没有根)。少数结果(如习题 1C.13)还需要假设 $1+1\neq0$,而二元域恰好不满足这一点。

下列哪一个不是域?

复数complex number有序实数对 $(a,b)$,写作 $a+bi$;乘法满足 $i^2=-1$,几何上是「长度相乘、角度相加」。
标量scalar𝐅(ℝ 或 ℂ)中的元素,即「数」;用来强调它不是向量。
组 / n 元组list / n-tuple有限长度的有序序列 $(x_1,\dots,x_n)$:顺序有关、重复有意义。
坐标coordinate$(x_1,\dots,x_n)\in\mathbf{F}^n$ 中的第 $k$ 个分量 $x_k$。
加法逆元additive inverse满足 $x+(-x)=0$ 的 $-x$;在 ℝ² 中是等长反向的箭头。
数乘scalar multiplication数 × 向量 = 向量:$\lambda(x_1,\dots,x_n)=(\lambda x_1,\dots,\lambda x_n)$,几何上是伸缩(λ < 0 时反向)。
域field含 0 ≠ 1、能做加减乘除(除数非零)并满足 1.3 全部性质的集合,如 ℚ、ℝ、ℂ。
代数闭域algebraically closed field每个非常数多项式都有零点的域;ℂ 是,ℝ 不是。
本节要点
  • 复数 = 平面上的点;加法是平行四边形,乘法是「长度相乘、角度相加」。
  • 𝐅 表示 ℝ 或 ℂ,其元素叫标量;对 𝐅 证明的结论对两者都成立。
  • 𝐅ⁿ = 长度为 n 的组;加法、加法逆元、数乘都按坐标进行,在 ℝ² 中分别是头尾相接、反向、伸缩。

1B 向量空间的定义 Definition of Vector Space

这一节要回答:除了 𝐅ⁿ,还有哪些东西也能「像向量一样」相加和数乘?Axler 的做法是:把 𝐅ⁿ 中加法与数乘满足的运算规律抽出来当作定义。凡是满足这些规律的「集合 + 运算」,都叫向量空间,前面对 𝐅ⁿ 的直觉就能搬过去用。

回顾 𝐅ⁿ:加法满足交换律、结合律,并且有单位元(零向量);每个元素都有加法逆元;数乘满足结合律;数 1 乘以向量不改变它;加法与数乘之间由分配律联系起来。下面就把这些性质变成定义。

定义加法、数乘addition, scalar multiplication1.19
  • 集合 $V$ 上的加法(addition)是一个函数:对每一对 $u,v\in V$,指定一个元素 $u+v\in V$。
  • 集合 $V$ 上的数乘(scalar multiplication)是一个函数:对每个 $\lambda\in\mathbf{F}$ 与每个 $v\in V$,指定一个元素 $\lambda v\in V$。
藏在定义里的「封闭性」

注意两处「$\in V$」:运算的结果必须仍落在 $V$ 里。如果结果可能跑到 $V$ 外面(比如 $V$ 是第一象限,$\lambda=-1$ 时 $\lambda v$ 就跑出去了),那这个运算根本不算「$V$ 上的」数乘(加法同理)。检验向量空间时,这一步最容易被忘记。

定义向量空间vector space1.20

向量空间是一个集合 $V$,连同 $V$ 上的一个加法和一个数乘,满足下列性质(对所有 $u,v,w\in V$ 与 $a,b\in\mathbf{F}$):

性质要求通俗理解
交换律 commutativity$u+v=v+u$加的先后无所谓
结合律 associativity$(u+v)+w=u+(v+w)$,$(ab)v=a(bv)$连加、连乘不用管括号
加法单位元 additive identity存在 $0\in V$,使 $v+0=v$ 对所有 $v$ 成立有一个「什么也不做」的向量
加法逆元 additive inverse对每个 $v\in V$,存在 $w\in V$ 使 $v+w=0$每一步都能「退回去」
乘法单位元 multiplicative identity$1v=v$乘以数 1 不改变向量
分配律 distributive properties$a(u+v)=au+av$,$(a+b)v=av+bv$加法与数乘之间唯一的「接口」

共 6 组、8 个等式。常说的「向量空间公理」指的就是它们。

为什么要这样抽象?

好处是一次证明,处处适用:只要某个结论的证明只用到了这张表里的规律,它就同时对 𝐅ⁿ、数列、函数、多项式、矩阵……全部成立。下面马上会看到,「向量」可以是箭头,也可以是数列、函数,甚至是些看起来很古怪的对象——只要加法和数乘守规矩。

定义向量、点vector, point1.21

向量空间的元素叫做向量(vector)或点(point)。这只是借用几何语言帮助直觉。

数乘依赖于 𝐅,所以严格地说应当说「$V$ 是 𝐅 上的向量空间」(vector space over F)。例如 ℝⁿ 是 ℝ 上的向量空间,ℂⁿ 是 ℂ 上的向量空间。

定义实向量空间、复向量空间real vector space, complex vector space1.22

ℝ 上的向量空间叫实向量空间(real vector space);ℂ 上的向量空间叫复向量空间(complex vector space)。通常 𝐅 是哪一个要么从上下文看得出,要么无关紧要,所以我们常常让 𝐅「潜伏在背景里」而不特别提起。

最简单的向量空间是只含一个点的 {0}。配上通常的加法与数乘,𝐅ⁿ 是 𝐅 上的向量空间(请自行验证)——它正是这个定义的原型。下面是两个元素「不是有限长数组」的例子。

例数列空间 𝐅∞F^∞1.23

$\mathbf{F}^\infty$ 是由 𝐅 中元素组成的全体数列:$\mathbf{F}^\infty=\{(x_1,x_2,\dots): x_k\in\mathbf{F},\ k=1,2,\dots\}$。加法与数乘都按「对应项」进行:$(x_1,x_2,\dots)+(y_1,y_2,\dots)=(x_1+y_1,x_2+y_2,\dots)$,$\lambda(x_1,x_2,\dots)=(\lambda x_1,\lambda x_2,\dots)$。这样 $\mathbf{F}^\infty$ 成为 𝐅 上的向量空间,零向量是全为 0 的数列。

定义记号 𝐅Snotation: F^S1.24

若 $S$ 是一个集合,$\mathbf{F}^S$ 表示从 $S$ 到 𝐅 的全体函数。对 $f,g\in\mathbf{F}^S$ 与 $\lambda\in\mathbf{F}$,加法与数乘都逐点定义:

$$(f+g)(x)=f(x)+g(x),\qquad (\lambda f)(x)=\lambda f(x)\qquad\text{对所有 } x\in S.$$

例如 $S=[0,1]$、$\mathbf{F}=\mathbf{R}$ 时,$\mathbf{R}^{[0,1]}$ 就是区间 $[0,1]$ 上全体实值函数的集合。

例𝐅S 是向量空间F^S is a vector space1.25
  • 若 $S$ 非空,则 $\mathbf{F}^S$(配上述运算)是 𝐅 上的向量空间。
  • 它的加法单位元是零函数 $0:S\to\mathbf{F}$,$0(x)=0$ 对所有 $x\in S$。
  • $f$ 的加法逆元是函数 $-f$,$(-f)(x)=-f(x)$——把图像关于横轴翻过来。
𝐅ⁿ 其实就是 𝐅{1,…,n}

把 $(x_1,\dots,x_n)$ 的第 $k$ 个坐标写成 $x(k)$,向量就变成了定义在 $\{1,2,\dots,n\}$ 上的函数 $k\mapsto x(k)$;同理数列空间 $\mathbf{F}^\infty$ 就是 $\mathbf{F}^{\{1,2,\dots\}}$。所以 𝐅ⁿ 是 $\mathbf{F}^S$ 的特例。反过来,$[0,1]$ 上的函数可以看成「每个 $x\in[0,1]$ 都是一个坐标」的向量。原书页边注强调:$\mathbf{R}^{[0,1]}$ 的元素是函数,不是组;一般的向量空间是抽象的东西,其元素可能是组、函数,或者更怪的对象。

从 𝐅ⁿ 到函数:向量就是一张「坐标图」

把 ℝⁿ 的向量画成 n 根「棒棒糖」:第 k 根的高度就是第 k 个坐标。增大坐标个数 n,看棒子怎样连成曲线。蓝色是 $f$,红色是 $g$,绿色是 $af+bg$(a、b 用滑块调)。n ≤ 8 时可以上下拖动蓝、红圆点任意改坐标;拖动图顶部的橙色三角选择观察位置。

fga f + b g观察位置

n 个坐标的向量就是 $\{1,\dots,n\}$ 上的函数;坐标越多,棒棒糖越密,最后连成曲线——$[0,1]$ 上的函数不过是「有无穷多个坐标」的向量。无论 n 多大,$af+bg$ 都是在每个位置上各算各的(逐点运算),这正是 1.13 与 1.24 的共同点。取 a = −1、b = 0 得到 $-f$(关于横轴翻转);a = b = 0 得到零向量,也就是零函数。

动手检验:哪些「加法 + 数乘」满足全部公理?

判断一个结构是不是向量空间,分两步:先看运算是否封闭(1.19:结果必须留在集合里),再逐条检查 1.20 的 8 个等式。下面的检验器准备了 7 个候选,其中有的是向量空间,有的恰好只违反一条——这能帮你体会每条公理「管」的是什么。

公理检验器:这是向量空间吗?

选择一个候选。拖动图中的 u、v、w 三个点,用滑块改变数 a、b;点击表格某一行,图上会画出这一行等式的左边(绿色实心方块)与右边(紫色空心圆)——两者重合,这一行就对当前数值成立。「找反例」会把数值调到一个使该行失败的例子。表中的 + 与数乘都指该候选自己定义的运算。

条目要求当前数值:左边 | 右边当前对所有

① 与 ⑤ 满足全部条目,是向量空间——⑤ 的零向量竟然是 (1, 1),$v$ 的「负向量」是 $(1/v_1,1/v_2)$!② 同时违反交换律、加法结合律和第二分配律;③ 只违反 $(a+b)v=av+bv$;④ 只违反 $1v=v$——说明这一条不是多余的;⑥ 和 ⑦ 的数乘不封闭(⑥ 还缺加法逆元),所以连「集合上的数乘」都算不上。注意「当前」一列可能碰巧显示 ✓(比如 u = v 时交换律当然成立),而「对所有」一列才是结论:要求对所有向量和数都成立。

常见误区
  • 忘记封闭性。第一象限、整数格点看起来很「规矩」,但数乘会把点带出集合。
  • 以为零向量一定是 (0, 0)。零向量由运算决定:在候选 ⑤ 中它是 (1, 1)。定义只要求「存在某个 0 使 $v+0=v$」。
  • 以为 $1v=v$ 可有可无。候选 ④(数乘一律得 0)满足其余全部条目,唯独不满足它。

在候选 ⑤((0,∞)²,「加法」为坐标相乘,「数乘」为取幂)中,零向量(加法单位元)是什么?

由公理推出的基本性质

定义只要求「存在」零向量和逆元。下面几条结果说明:它们其实是唯一的,而且数 0、数 −1 与向量的关系正如直觉所料。它们的证明是本书第一批「纯粹从公理出发」的证明——每一步都必须能指出用了哪一条公理。

定理加法单位元唯一unique additive identity1.26

向量空间只有一个加法单位元。

定理加法逆元唯一unique additive inverse1.27

向量空间中每个元素只有一个加法逆元。

定义记号 −v、w − vnotation: −v, w − v1.28

因为逆元唯一,下面的记号才有意义:设 $v,w\in V$,$-v$ 表示 $v$ 的加法逆元;$w-v$ 定义为 $w+(-v)$。

全书的约定 1.29

从这里开始直到全书结束,$V$ 总表示 𝐅 上的一个向量空间。原书用这个「一劳永逸的声明」省去反复交代。

定理数 0 乘向量the number 0 times a vector1.30

对每个 $v\in V$,$0v=0$。

定理数乘零向量a number times the vector 01.31

对每个 $a\in\mathbf{F}$,$a0=0$。

定理数 −1 乘向量the number −1 times a vector1.32

对每个 $v\in V$,$(-1)v=-v$。

1.30 与 1.31 不是一回事

1.30 左边的 0 是数、右边的 0 是零向量:「数 0 乘任何向量得零向量」。1.31 左右两边的 0 都是零向量:「任何数乘零向量得零向量」。两者都要用到分配律——因为公理中只有分配律把加法和数乘联系起来,而 1.30、1.31 恰好同时涉及零向量(加法)与数乘。

下面的步骤播放器逐条给出证明;图中高亮的是这一步用到的公理。

1.26 加法单位元唯一

设 $0$ 与 $0'$ 都是 $V$ 的加法单位元。那么

$$0'=0'+0=0+0'=0.$$

第一个等号:$0$ 是加法单位元;第二个:交换律;第三个:$0'$ 是加法单位元。所以 $0'=0$。

1.27 加法逆元唯一

设 $w$ 与 $w'$ 都是 $v$ 的加法逆元($v+w=0$,$v+w'=0$)。那么

$$w=w+0=w+(v+w')=(w+v)+w'=0+w'=w'.$$

依次用了:加法单位元、$w'$ 是逆元、加法结合律、$w$ 是逆元(配合交换律)、加法单位元(配合交换律)。

1.30 数 0 乘向量得零向量

对 $v\in V$,因为数 $0+0=0$,由第二分配律

$$0v=(0+0)v=0v+0v.$$

两边同时加上 $0v$ 的加法逆元(再用结合律和单位元化简),得到 $0=0v$。

1.31 数乘零向量得零向量

对 $a\in\mathbf{F}$,因为零向量满足 $0+0=0$,由第一分配律

$$a0=a(0+0)=a0+a0.$$

两边同时加上 $a0$ 的加法逆元,得到 $0=a0$。与上一步几乎一模一样,只是分配律换成了另一条。

1.32 数 −1 乘向量得负向量

对 $v\in V$,

$$v+(-1)v=1v+(-1)v=\bigl(1+(-1)\bigr)v=0v=0.$$

用了乘法单位元、第二分配律和刚证明的 1.30。这说明 $(-1)v$ 加上 $v$ 得 0,即 $(-1)v$ 是 $v$ 的加法逆元;由逆元唯一(1.27),$(-1)v=-v$。

证明 0v = 0(1.30)时,下列哪条公理是必不可少的?

空集不是向量空间。它违反了定义 1.20 中的哪一条?(习题 1B.4)

向量空间vector space集合 $V$ + 加法 + 数乘,满足交换律、结合律、加法单位元、加法逆元、$1v=v$、分配律。
加法单位元(零向量)additive identity满足 $v+0=v$(对所有 $v$)的元素 $0$;它是唯一的(1.26)。
实 / 复向量空间real / complex vector space标量取自 ℝ / ℂ 的向量空间;说「𝐅 上的向量空间」以明确标量范围。
数列空间 𝐅∞F^∞𝐅 中元素的全体数列 $(x_1,x_2,\dots)$,按对应项相加、数乘。
函数空间 𝐅SF^S从集合 $S$ 到 𝐅 的全体函数,逐点相加、数乘;零向量是零函数。
向量 / 点vector / point向量空间的元素;可以是箭头、数组、数列、函数……
本节要点
  • 向量空间 = 集合 + 封闭的加法与数乘 + 8 条运算规律;标量取自 𝐅。
  • 𝐅ⁿ、𝐅∞、𝐅S 都是向量空间;函数也是向量,运算逐点进行,𝐅ⁿ = 𝐅{1,…,n}。
  • 从公理可推出:零向量与负向量唯一;$0v=0$,$a0=0$,$(-1)v=-v$。关键工具是分配律。

1C 子空间 Subspaces

这一节要回答:一个向量空间里面还「藏着」哪些小的向量空间?怎样快速识别它们?又怎样把几个子空间拼起来?借助子空间,我们手里的向量空间例子会一下子多出很多。

定义子空间subspace1.33

$V$ 的子集 $U$ 叫做 $V$ 的子空间,如果 $U$ 在与 $V$ 相同的加法单位元、加法和数乘之下,本身也是一个向量空间。(有人称之为线性子空间(linear subspace),意思一样。)

按定义逐条验证 8 个等式太麻烦。下面的结果给出了最省事的检验方法——只需三条。

定理子空间的条件conditions for a subspace1.34

$V$ 的子集 $U$ 是 $V$ 的子空间,当且仅当 $U$ 满足以下三条:

  • 含加法单位元 additive identity:$0\in U$;
  • 对加法封闭 closed under addition:$u,w\in U$ 蕴含 $u+w\in U$;
  • 对数乘封闭 closed under scalar multiplication:$a\in\mathbf{F}$、$u\in U$ 蕴含 $au\in U$。
证明思路

核心想法:交换律、结合律、分配律这些「对所有向量成立」的等式,在大空间 $V$ 里已经成立,搬到小集合 $U$ 上自然成立;真正需要检查的只有「结果留不留在 $U$ 里」和「$U$ 里有没有 0 与负向量」。

若 $U$ 是子空间,它本身是向量空间,三条显然成立。反之,设三条成立:第一条保证 $V$ 的零向量在 $U$ 中;后两条保证加法、数乘是 $U$ 上的运算。若 $u\in U$,则 $-u=(-1)u$(由 1.32)也在 $U$ 中(数乘封闭),所以每个元素在 $U$ 中都有逆元。其余性质在 $V$ 上成立,因而在 $U$ 上也成立。∎

直觉与快速判别

子空间 = 「过原点、并且加法和数乘都跑不出去」的子集。检验时先看 0 在不在:不在就立刻否定。页边注还指出,「$0\in U$」可以换成「$U$ 非空」(任取 $u\in U$,$0u=0$ 就在 $U$ 中)——但如果 $U$ 真是子空间,证明非空最快的办法通常还是直接验证 $0\in U$。

子空间检验器:ℝ² 里的这些子集是子空间吗?

选择一个子集 U(阴影或粗线)。拖动 U 中的两点 u(蓝)与 w(红)——它们只能在 U 里移动;绿色是 $u+w$,紫色是 $\lambda u$。结果落在 U 内画 ✓、跑出 U 画 ✗;原点处标出 $0\in U$ 是否成立。「找反例」会自动摆出一个让 U 失败的例子。

只有 {0}、过原点的直线(c = 0)和整个 ℝ² 能通过全部三项检验——它们恰好是 ℝ² 的全部子空间。把直线的偏移 c 调离 0,原点立刻不在 U 中,$u+w$、$\lambda u$ 也纷纷跑出去。两条直线的并对数乘封闭,对加法却不封闭(θ = 0 时两线重合,并集又变回子空间,见习题 1C.12)。第一象限、上半平面对加法封闭,但 λ < 0 时数乘出界;整数格点对加法和取负都封闭,λ = ½ 却不行(习题 1C.7)。

这三条通常让我们很快判断一个子集是不是子空间。原书请读者自行验证下面每一个断言。

例子空间subspaces1.35
  1. 设 $b\in\mathbf{F}$,则 $\{(x_1,x_2,x_3,x_4)\in\mathbf{F}^4: x_3=5x_4+b\}$ 是 𝐅⁴ 的子空间,当且仅当 $b=0$。($b\neq0$ 时零向量不满足方程;$b=0$ 时方程是「齐次」的,两个解之和、解的倍数仍是解。)
  2. $[0,1]$ 上全体连续实值函数构成 $\mathbf{R}^{[0,1]}$ 的子空间。(连续函数之和、数乘仍连续。)
  3. ℝ 上全体可微实值函数构成 $\mathbf{R}^{\mathbf{R}}$ 的子空间。(可微函数之和、数乘仍可微。)
  4. 区间 $(0,3)$ 上满足 $f'(2)=b$ 的全体可微实值函数构成 $\mathbf{R}^{(0,3)}$ 的子空间,当且仅当 $b=0$。($(f+g)'(2)=2b$,$(cf)'(2)=cb$,只有 $b=0$ 时才能留在集合里;零函数的导数也是 0。)
  5. 全体极限为 0 的复数列构成 $\mathbf{C}^\infty$ 的子空间。(极限的加法、数乘法则。)

验证这些断言,暴露了微积分背后的线性结构:(b) 用到「连续函数之和仍连续」,(d) 用到「常数 $c$ 乘 $f$ 的导数等于 $c$ 乘 $f$ 的导数」。

{0} 是 $V$ 最小的子空间,$V$ 本身是最大的子空间。空集不是子空间:子空间必须是向量空间,至少要含一个元素——加法单位元。

ℝ² 的子空间恰好是 {0}、过原点的直线、ℝ² 本身;ℝ³ 的子空间恰好是 {0}、过原点的直线、过原点的平面、ℝ³ 本身。证明它们都是子空间很容易;难的一半是证明没有别的——要等第 2 章有了「维数」这个工具才方便。

下列 ℝ² 的子集中,哪一个是子空间?

子空间的和 Sums of Subspaces

处理向量空间时,我们通常只关心子空间,而不是任意子集。两个子空间的并集很少是子空间(上面检验器里的「x 轴 ∪ 另一条直线」就是例子,另见习题 1C.12),所以我们改用「和」。

定义子空间的和sum of subspaces1.36

设 $V_1,\dots,V_m$ 是 $V$ 的子空间。它们的和记作 $V_1+\dots+V_m$,是从每个子空间各取一个元素相加所能得到的全体向量:

$$V_1+\dots+V_m=\{v_1+\dots+v_m: v_1\in V_1,\dots,v_m\in V_m\}.$$
例𝐅³ 中子空间的和a sum of subspaces of F³1.37

设 $U=\{(x,0,0)\in\mathbf{F}^3: x\in\mathbf{F}\}$(x 轴),$W=\{(0,y,0)\in\mathbf{F}^3: y\in\mathbf{F}\}$(y 轴)。则 $U+W=\{(x,y,0): x,y\in\mathbf{F}\}$(整个 xy 平面),因为 $(x,y,0)=(x,0,0)+(0,y,0)$。

例 1.37 的图像:两条轴的并集只是一个「十字」(左);它们的和却是整个 xy 平面(右)——平面上每一点都能走「先沿 x 轴、再沿 y 轴」到达。
例𝐅⁴ 中子空间的和a sum of subspaces of F⁴1.38

设 $U=\{(x,x,y,y)\in\mathbf{F}^4: x,y\in\mathbf{F}\}$,$W=\{(x,x,x,y)\in\mathbf{F}^4: x,y\in\mathbf{F}\}$。用文字说:$U$ 是「前两个坐标相等、后两个坐标相等」的向量;$W$ 是「前三个坐标相等」的向量。

取 $U$ 的典型元素 $(a,a,b,b)$ 与 $W$ 的典型元素 $(c,c,c,d)$:$(a,a,b,b)+(c,c,c,d)=(a+c,a+c,b+c,b+d)$,前两个坐标总相等,所以

$$U+W\subseteq\{(x,x,y,z)\in\mathbf{F}^4: x,y,z\in\mathbf{F}\}.$$1.39

反过来,任给 $x,y,z$,有 $(x,x,y,z)=(x,x,y,y)+(0,0,0,z-y)$,前者属于 $U$、后者属于 $W$。所以 1.39 的反向包含也成立:$U+W=\{(x,x,y,z)\in\mathbf{F}^4: x,y,z\in\mathbf{F}\}$,即前两个坐标相等的全体向量。

例 1.38 可视化:把 𝐅⁴ 中的 v 拆成 u + w

𝐅⁴ 画不出来,但 4 个坐标可以画成 4 根柱子。上下拖动右侧 v 的柱顶(吸附到 0.5)。左边 $u\in U$ 必须形如 $(a,a,b,b)$,中间 $w\in W$ 必须形如 $(c,c,c,d)$。拖动 t 滑块:分解在变,但 $u+w$ 始终等于 $v$。再把第二个子空间换成 $W'=\{(0,0,0,d)\}$ 试试。

U + W 中的向量前两个坐标一定相等(1.39);把 v 的前两根柱子拖得不一样高,v 就不在 U + W 中,无法分解。对 W,每个 t 都给出一种分解:$u=(x-t,x-t,y-t,y-t)$,$w=(t,t,t,z-y+t)$(t = 0 就是原书的那一种);两种分解相差 $(t,t,t,t)$,它恰好同时属于 U 和 W。换成 W′ 后,和仍是同一个空间 {(x, x, y, z)},但 t 失去作用——分解唯一,因为 U ∩ W′ = {0}。这正是下面「直和」要刻画的区别。

下面的结果说明:子空间的和仍是子空间,而且是包含所有加项的最小子空间(即任何包含所有加项的子空间都包含它们的和)。

定理子空间的和是包含它们的最小子空间sum of subspaces is the smallest containing subspace1.40

设 $V_1,\dots,V_m$ 是 $V$ 的子空间,则 $V_1+\dots+V_m$ 是 $V$ 中包含 $V_1,\dots,V_m$ 的最小子空间。

证明思路

是子空间:$0=0+\dots+0$ 在其中;两个和相加、一个和乘以数,重新组合后仍是「每个 $V_k$ 各出一项」的和(用到交换律、结合律、分配律以及每个 $V_k$ 的封闭性)。由 1.34,它是子空间。

包含每个 $V_k$:考虑除了第 $k$ 项之外全取 0 的和 $0+\dots+v_k+\dots+0$。

最小:任何包含 $V_1,\dots,V_m$ 的子空间对加法封闭,因而包含所有有限和 $v_1+\dots+v_m$,也就包含 $V_1+\dots+V_m$。∎

类比:和 ↔ 并

在集合论里,包含两个子集的最小子集是它们的并;在向量空间里,包含两个子空间的最小子空间是它们的和。并集不够用(常常对加法不封闭),和恰好把缺的那些「u + w」补齐。

设 U、W 是 ℝ² 中两条不同的过原点直线,U + W 是什么?

直和 Direct Sums

设 $V_1,\dots,V_m$ 是 $V$ 的子空间。$V_1+\dots+V_m$ 的每个元素都能写成 $v_1+\dots+v_m$($v_k\in V_k$)的形式。特别值得关注的是:每个向量都只有一种写法的情形。上面的 𝐅⁴ 演示里,W 给出无穷多种写法,W′ 只给出一种——这种「唯一分解」重要到有专门的名字(直和)和专门的符号(⊕)。

定义直和、⊕direct sum, ⊕1.41

设 $V_1,\dots,V_m$ 是 $V$ 的子空间。

  • 如果 $V_1+\dots+V_m$ 中每个元素写成 $v_1+\dots+v_m$(每个 $v_k\in V_k$)的方式都唯一,就称这个和是直和(direct sum)。
  • 此时把 $V_1+\dots+V_m$ 记作 $V_1\oplus\dots\oplus V_m$;⊕ 这个记号本身就在提示「这是直和」。
直觉:直和 = 像坐标一样的分解

直和意味着每个向量在各个子空间里的「分量」是确定的,就像点的坐标是确定的一样。例如 𝐅³ = xy 平面 ⊕ z 轴:每个点都唯一地分成「影子」$(x,y,0)$ 加「高度」$(0,0,z)$。原书页边注:⊕ 是圆圈里的加号,提醒我们这是一种特殊的子空间之和——其中每个元素都只能以一种方式写成各子空间元素之和。

例两个子空间的直和a direct sum of two subspaces1.42

$U=\{(x,y,0)\}$(最后一个坐标为 0),$W=\{(0,0,z)\}$(前两个坐标为 0)。则 $\mathbf{F}^3=U\oplus W$:$(x,y,z)$ 只能拆成 $(x,y,0)+(0,0,z)$。

例多个子空间的直和a direct sum of multiple subspaces1.43

设 $V_k$ 是 𝐅ⁿ 中「除第 $k$ 个坐标外全为 0」的向量组成的子空间(第 $k$ 条坐标轴),例如 $V_2=\{(0,x,0,\dots,0)\}$。则 $\mathbf{F}^n=V_1\oplus\dots\oplus V_n$。

反例有时和例子一样能帮助理解。下面的例子里,三个子空间的和是整个 𝐅³,却不是直和——尽管它们两两之间只交于 0。

例不是直和的和a sum that is not a direct sum1.44

$V_1=\{(x,y,0)\}$,$V_2=\{(0,0,z)\}$,$V_3=\{(0,y,y)\}$(均在 𝐅³ 中)。播放下面的步骤看清楚发生了什么。

第 1 步:三个子空间

$V_1$ = xy 平面(蓝),$V_2$ = z 轴(红),$V_3$ = 直线 $\{(0,y,y)\}$(绿,位于 yz 平面内,与 y 轴成 45°)。

第 2 步:两两只交于 0

$V_1\cap V_2=\{0\}$;$V_3$ 中的点 $(0,y,y)$ 落在 xy 平面上当且仅当 $y=0$,所以 $V_1\cap V_3=\{0\}$;它落在 z 轴上同样要求 $y=0$,所以 $V_2\cap V_3=\{0\}$。

第 3 步:和是整个 𝐅³

任意 $(x,y,z)=(x,y,0)+(0,0,z)+(0,0,0)$,三项依次属于 $V_1,V_2,V_3$,所以 $\mathbf{F}^3=V_1+V_2+V_3$。图中的粗箭头 $v$ 被拆成蓝(在 xy 平面里)+ 红(竖直)。

第 4 步:但 0 有两种写法

除了 $0=0+0+0$,还有

$$(0,0,0)=(0,1,0)+(0,0,1)+(0,-1,-1),$$

三项依次属于 $V_1,V_2,V_3$。图中三段箭头头尾相接,绕一圈回到原点。

第 5 步:结论

0 的写法不唯一,所以 $V_1+V_2+V_3$ 不是直和(下面的 1.45 说明只需看 0)。教训:三个及以上子空间时,「两两交集都是 {0}」不能保证直和——1.46 的简单判别法只适用于两个子空间。

直和的定义要求每个向量都有唯一的表示。下面的结果说明:判断是否为直和时,只需检查 0 这一个向量的表示是否唯一。

定理直和的判别条件condition for a direct sum1.45

设 $V_1,\dots,V_m$ 是 $V$ 的子空间。则 $V_1+\dots+V_m$ 是直和,当且仅当把 0 写成 $v_1+\dots+v_m$($v_k\in V_k$)的唯一方式是取每个 $v_k=0$。

证明思路

核心想法:两种写法相减,就得到 0 的一种写法。

「⇒」由直和的定义直接得到。「⇐」设 0 只能平凡地写出。任取 $v\in V_1+\dots+V_m$,若 $v=v_1+\dots+v_m=u_1+\dots+u_m$($v_k,u_k\in V_k$),相减得 $0=(v_1-u_1)+\dots+(v_m-u_m)$,其中 $v_k-u_k\in V_k$。由假设每个 $v_k-u_k=0$,即 $v_k=u_k$:两种写法其实相同。∎

对两个子空间,还有一个更简单的判别法(符号 ⟺ 读作「当且仅当」)。

定理两个子空间的直和direct sum of two subspaces1.46

设 $U$、$W$ 是 $V$ 的子空间。则

$$U+W\ \text{是直和}\iff U\cap W=\{0\}.$$
证明思路

核心想法:交集里的非零向量 $v$ 会造出 0 的一种非平凡写法 $0=v+(-v)$;反之亦然。

「⇒」设 $U+W$ 是直和,$v\in U\cap W$。则 $0=v+(-v)$,其中 $v\in U$、$-v\in W$。由 0 的表示唯一,$v=0$。所以 $U\cap W=\{0\}$。

「⇐」设 $U\cap W=\{0\}$,且 $0=u+w$($u\in U$,$w\in W$)。则 $u=-w\in W$,于是 $u\in U\cap W$,所以 $u=0$,进而 $w=0$。由 1.45,$U+W$ 是直和。∎

类比:直和 ↔ 不交并

子空间的和类似于子集的并;直和则类似于不交的并。但两个子空间不可能不相交——它们都含 0。所以「不相交」被换成了「交集只有 0」(至少对两个子空间是这样)。

常见误区
  • 「交集为空」:两个子空间的交集至少含 0,永远不会是空集。正确的条件是 U ∩ W = {0}。
  • 「直和就是互相垂直」:不需要垂直。x 轴与直线 y = x 并不垂直,但它们的和是直和(下面演示的预设 e)。
  • 把 1.46 用到三个子空间上:例 1.44 两两交于 0,却不是直和。三个及以上要用 1.45。
ℝ³ 中的 U + W 与直和

选择两个子空间 U(蓝)与 W(红),在图中拖动可旋转视角(或按「自动旋转」——转起来最容易看清立体关系)。黄色虚线是 U ∩ W(当它不只是 {0} 时);浅绿色平面是 U + W(当它是一个平面时)。用 v₁、v₂、v₃ 滑块选定向量 v(最粗的箭头;浅色模式下为黑色,深色模式下为白色),图中把它拆成 $u\in U$ 与 $w\in W$;若分解不唯一,拖动 t 看其它分解。

U + W 就是所有 $u+w$ 能到达的地方:两条不同直线的和是它们所在的平面;平面加上一条不在其中的直线,就得到整个 ℝ³。只要 U ∩ W = {0},v 的分解就唯一(t 滑块不起作用);U ∩ W 是一条直线时,u 可以沿这条直线任意滑动、w 反向补偿,分解有无穷多种。把 α 调小:W 越贴近 U,分解出的 u、w 就越长(数值上越「不稳定」);α = 0 时 W 落进 U,U + W 塌缩成平面,也不再是直和。

直和的想法不限于箭头。函数空间里也有非常自然的直和分解(这就是习题 1C.24):

函数空间里的直和:任何函数 = 偶函数 + 奇函数

选择函数 f(最粗的曲线:浅色模式下为黑色,深色模式下为白色)。蓝色是偶部 $f_e(x)=\frac{f(x)+f(-x)}{2}$(关于纵轴对称),红色是奇部 $f_o(x)=\frac{f(x)-f(-x)}{2}$(关于原点对称)。拖动橙色三角选择位置 $x_0$,看 $f(x_0)=f_e(x_0)+f_o(x_0)$,以及 $-x_0$ 处的对称关系。

f偶部 fₑ奇部 fₒ镜像 f(−x)(虚线)x₀ 与 −x₀

对任何 $f$,偶部加奇部都还原出 $f$,所以 $\mathbf{R}^{\mathbf{R}}=V_e+V_o$;既偶又奇的函数只能是零函数($g(x)=g(-x)=-g(x)$),所以 $V_e\cap V_o=\{0\}$。由 1.46,$\mathbf{R}^{\mathbf{R}}=V_e\oplus V_o$:每个函数拆成「偶 + 奇」的方式唯一。例如 $e^x$ 的偶部、奇部分别是 $\cosh x$ 与 $\sinh x$;$x^2+x-1$ 的偶部是 $x^2-1$、奇部是 $x$。

设 U、W 是 V 的两个子空间。U + W 是直和的充要条件是什么?

子空间subspace在相同运算下自身也是向量空间的子集;等价于:含 0、对加法和数乘封闭(1.34)。
对加法封闭closed under addition$u,w\in U\Rightarrow u+w\in U$:集合里的元素相加跑不出这个集合。
子空间的和sum of subspaces$V_1+\dots+V_m=\{v_1+\dots+v_m: v_k\in V_k\}$,是包含各 $V_k$ 的最小子空间。
直和direct sum每个元素写成 $v_1+\dots+v_m$ 的方式唯一的和,记作 $V_1\oplus\dots\oplus V_m$。
线性子空间linear subspace「子空间」的另一种说法,意思完全相同。
偶函数 / 奇函数even / odd function$f(-x)=f(x)$ / $f(-x)=-f(x)$;两类各成子空间,且 $\mathbf{R}^{\mathbf{R}}=V_e\oplus V_o$。
本节要点
  • 子空间三条件:$0\in U$、加法封闭、数乘封闭;ℝ² 的子空间是 {0}、过原点的直线、ℝ²。
  • 并集一般不是子空间;和 $U+W$ 是包含 $U$、$W$ 的最小子空间。
  • 直和 = 分解唯一 ⇔ 0 的分解唯一(1.45);两个子空间时 ⇔ $U\cap W=\{0\}$(1.46);三个以上时两两交为 0 不够。

本章小结

  • 复数与 𝐅:$a+bi$ 就是平面上的点 $(a,b)$;加法是平行四边形,乘法是「长度相乘、角度相加」。ℝ 与 ℂ 统称 𝐅,其元素叫标量。
  • 𝐅ⁿ:长度为 n 的组;加法、负向量、数乘都按坐标进行。ℝ² 中分别对应头尾相接、反向、伸缩;高维画不出,但照样能算。
  • 向量空间(1.20):集合 + 封闭的加法与数乘 + 8 条运算规律。例子:𝐅ⁿ、𝐅∞、𝐅S——函数也是向量,𝐅ⁿ 不过是 𝐅{1,…,n}。
  • 公理的推论(1.26–1.32):零向量唯一、负向量唯一;$0v=0$,$a0=0$,$(-1)v=-v$。关键是分配律——唯一连接加法与数乘的公理。
  • 子空间(1.34):含 0、对加法封闭、对数乘封闭。ℝ² 的子空间:{0}、过原点的直线、ℝ²;ℝ³ 再加上过原点的平面。
  • 和(1.40):$U+W$ 是包含 $U$、$W$ 的最小子空间(并集通常不是子空间)。
  • 直和(1.41–1.46):分解唯一;等价于 0 的分解唯一;两个子空间时等价于 $U\cap W=\{0\}$。三个及以上时,两两交为 {0} 不够(例 1.44)。
要判断检查什么典型反例
是向量空间吗?1.20运算封闭(1.19)+ 8 条性质第一象限(数乘不封闭);「λv = 0」($1v\neq v$);空集(没有 0)
是子空间吗?1.34$0\in U$;加法封闭;数乘封闭不过原点的直线;两条直线的并;整数格点
是直和吗?1.45 1.460 只能写成 $0+\dots+0$;两个子空间时看 $U\cap W=\{0\}$例 1.44:两两交于 0,却不是直和

与后面各章的联系:第 2 章引入张成 (span)、线性无关 (linear independence)、基 (basis) 与维数 (dimension),届时才能证明「ℝ² 的子空间只有那三类」,并得到子空间之和的维数公式;第 3 章的线性映射作用在这里定义的向量空间之间,其零空间与值域都是子空间;复数的引入会在第 5 章显示出威力:有限维非零复向量空间上的每个算子都有特征值。

自测

前面各节已穿插了 9 道小题,这里再补充 3 道综合题。

ℝ² 是复向量空间 ℂ² 的子空间吗?(习题 1C.5)

若 U 是 V 的子空间,U + U 等于什么?(习题 1C.15)

在向量空间 ℝ^[0,1](区间 [0,1] 上的实值函数)中,零向量是什么?

习题

以下选自原书各节末的习题(编号同原书),每题都附提示与完整解答。建议先自己想,再展开对照。

1A.7证明 $\dfrac{-1+\sqrt3\,i}{2}$ 是 1 的立方根(即它的立方等于 1)。
提示

先算平方,再乘一次。几何上看:这个数的长度和角度各是多少?(可以在复平面演示里验证。)

参考解答

记 $\omega=\frac{-1+\sqrt3 i}{2}$。则 $\omega^2=\frac{1-2\sqrt3 i+3i^2}{4}=\frac{-2-2\sqrt3 i}{4}=\frac{-1-\sqrt3 i}{2}$,于是

$\omega^3=\omega^2\omega=\frac{(-1-\sqrt3 i)(-1+\sqrt3 i)}{4}=\frac{(-1)^2-(\sqrt3 i)^2}{4}=\frac{1+3}{4}=1$。

几何解释:$|\omega|=\sqrt{\tfrac14+\tfrac34}=1$,角度为 120°;立方后长度仍为 1、角度为 360°,所以就是 1。

1A.8求 $i$ 的两个不同的平方根。
提示

设 $(a+bi)^2=i$($a,b\in\mathbf{R}$),比较实部与虚部。或者几何地想:什么数「转两次」等于转 90°?

参考解答

$(a+bi)^2=a^2-b^2+2abi=i$,所以 $a^2-b^2=0$ 且 $2ab=1$。由第二式 $a,b$ 同号,结合第一式得 $a=b$,于是 $2a^2=1$,$a=\pm\frac{1}{\sqrt2}$。

所以 $i$ 的两个平方根是 $\frac{1+i}{\sqrt2}$ 与 $-\frac{1+i}{\sqrt2}$。验证:$\left(\frac{1+i}{\sqrt2}\right)^2=\frac{1+2i+i^2}{2}=i$。几何上它们长度为 1、角度为 45° 与 225°,角度加倍后都是 90°(模 360°)。

1A.10说明为什么不存在 $\lambda\in\mathbf{C}$ 使得 $\lambda(2-3i,\ 5+4i,\ -6+7i)=(12-5i,\ 7+22i,\ -32-9i)$。
提示

数乘是逐个坐标进行的。第一个坐标就把 $\lambda$ 唯一确定了,再去检验其余坐标。

参考解答

若这样的 $\lambda$ 存在,比较第一个坐标:$\lambda=\frac{12-5i}{2-3i}=\frac{(12-5i)(2+3i)}{(2-3i)(2+3i)}=\frac{39+26i}{13}=3+2i$。

检验第二个坐标:$(3+2i)(5+4i)=15+12i+10i-8=7+22i$,吻合。检验第三个坐标:$(3+2i)(-6+7i)=-18+21i-12i-14=-32+9i\neq-32-9i$。矛盾,所以这样的 $\lambda$ 不存在。

1B.2设 $a\in\mathbf{F}$,$v\in V$,且 $av=0$。证明 $a=0$ 或 $v=0$。
提示

若 $a\neq0$,用 $\frac1a$ 去乘等式两边,并用 1.31。

参考解答

若 $a=0$,结论已成立。设 $a\neq0$,则

$v=1v=\left(\tfrac1a\cdot a\right)v=\tfrac1a(av)=\tfrac1a\,0=0$,

依次用到:乘法单位元、数的运算 $\frac1a a=1$、数乘结合律、已知条件 $av=0$,以及 1.31(数乘零向量得零向量)。∎

1B.3设 $v,w\in V$。说明为什么存在唯一的 $x\in V$ 使得 $v+3x=w$。
提示

像解方程一样「移项再除以 3」,但每一步都要能由公理说明。存在性:猜出 $x$ 并验证;唯一性:假设有两个解再作差。

参考解答

存在:令 $x=\tfrac13(w-v)$。则 $v+3x=v+3\cdot\tfrac13(w-v)=v+1(w-v)=v+(w+(-v))=w$(数乘结合律、乘法单位元,再用加法交换律、结合律与逆元化简)。

唯一:若 $v+3x=w=v+3x'$,两边加上 $-v$ 得 $3x=3x'$,再用 $\tfrac13$ 去乘,得 $x=x'$。∎

1B.6设 ∞ 与 −∞ 是两个不属于 ℝ 的不同对象,在 $\mathbf{R}\cup\{\infty,-\infty\}$ 上按「顾名思义」的方式定义运算:实数之间照常运算;对 $t\in\mathbf{R}$,$t\infty$ 当 $t\lt0,\ t=0,\ t\gt0$ 时分别为 $-\infty,\ 0,\ \infty$,$t(-\infty)$ 则分别为 $\infty,\ 0,\ -\infty$;并且 $t+\infty=\infty+t=\infty+\infty=\infty$,$t+(-\infty)=(-\infty)+t=(-\infty)+(-\infty)=-\infty$,$\infty+(-\infty)=(-\infty)+\infty=0$。这是 ℝ 上的向量空间吗?
提示

试试把 ∞、∞、−∞ 三个加起来,换一种加括号的方式。

参考解答

不是。加法结合律失败:

$(\infty+\infty)+(-\infty)=\infty+(-\infty)=0$,但 $\infty+\bigl(\infty+(-\infty)\bigr)=\infty+0=\infty$。

(第二分配律也失败:$\bigl(2+(-1)\bigr)\infty=1\infty=\infty$,而 $2\infty+(-1)\infty=\infty+(-\infty)=0$。)所以它不是向量空间。

1C.1判断 𝐅³ 的下列子集是否为子空间: (a) $\{x_1+2x_2+3x_3=0\}$;(b) $\{x_1+2x_2+3x_3=4\}$;(c) $\{x_1x_2x_3=0\}$;(d) $\{x_1=5x_3\}$。
提示

先看 0 在不在;再看条件是不是「齐次线性」的;非线性的条件往往对加法不封闭。

参考解答

(a) 是。0 满足方程;若 $x,y$ 都满足,则 $(x_1+y_1)+2(x_2+y_2)+3(x_3+y_3)=0+0=0$,$\lambda x_1+2\lambda x_2+3\lambda x_3=\lambda\cdot0=0$。

(b) 不是:$0+0+0=0\neq4$,零向量不在其中。

(c) 不是:$(1,1,0)$ 与 $(0,0,1)$ 都在其中(坐标乘积为 0),但它们的和 $(1,1,1)$ 的坐标乘积为 1,对加法不封闭。

(d) 是:$x_1-5x_3=0$ 是齐次线性方程,理由同 (a)。

1C.6(a) $\{(a,b,c)\in\mathbf{R}^3: a^3=b^3\}$ 是 ℝ³ 的子空间吗?(b) $\{(a,b,c)\in\mathbf{C}^3: a^3=b^3\}$ 是 ℂ³ 的子空间吗?
提示

在 ℝ 中,$a^3=b^3$ 能推出什么?在 ℂ 中,1 有三个立方根(习题 1A.7)。

参考解答

(a) 是。$t\mapsto t^3$ 在 ℝ 上严格递增,所以 $a^3=b^3\iff a=b$,这个集合就是 $\{(a,a,c)\}$:含 0,对加法与数乘封闭。

(b) 不是。取 $\omega=\frac{-1+\sqrt3 i}{2}$,$\omega^3=1$。$(1,1,0)$ 与 $(1,\omega,0)$ 都在集合中,但和 $(2,1+\omega,0)$ 不在:$2^3=8$,而 $1+\omega=\frac{1+\sqrt3 i}{2}$ 长度为 1、角度 60°,所以 $(1+\omega)^3=-1\neq8$。(这个集合含 0、对数乘也封闭,坏在加法。)

1C.7–8(7) 证明或举反例:若 $U$ 是 ℝ² 的非空子集,对加法封闭、对取加法逆元封闭($u\in U\Rightarrow -u\in U$),则 $U$ 是子空间。(8) 给出 ℝ² 的一个非空子集,它对数乘封闭,却不是子空间。
提示

在「子空间检验器」里找:哪个子集只坏在数乘?哪个子集只坏在加法?

参考解答

(7) 命题错误。反例:整数格点 $\mathbf{Z}^2$。它非空,两个整数点之和仍是整数点,整数点的相反数仍是整数点;但 $\tfrac12(1,0)=(\tfrac12,0)\notin\mathbf{Z}^2$,对数乘不封闭。

(8) 取两条坐标轴的并 $U=\{(x,0)\}\cup\{(0,y)\}$。任何数乘仍在同一条轴上,所以对数乘封闭;但 $(1,0)+(0,1)=(1,1)\notin U$。

1C.12证明:$V$ 的两个子空间之并是子空间,当且仅当其中一个包含另一个。
提示

反证:各取一个「只在自己里面」的向量 $u\in U\setminus W$、$w\in W\setminus U$,看 $u+w$ 能落在哪里。

参考解答

「⇐」若 $U\subseteq W$,则 $U\cup W=W$ 是子空间;$W\subseteq U$ 时同理。

「⇒」设 $U\cup W$ 是子空间,但 $U\not\subseteq W$ 且 $W\not\subseteq U$。取 $u\in U$、$u\notin W$,以及 $w\in W$、$w\notin U$。由加法封闭,$u+w\in U\cup W$。若 $u+w\in U$,则 $w=(u+w)-u\in U$,矛盾;若 $u+w\in W$,则 $u=(u+w)-w\in W$,矛盾。所以一个子空间必包含另一个。∎

1C.20设 $U=\{(x,x,y,y)\in\mathbf{F}^4: x,y\in\mathbf{F}\}$。找一个 𝐅⁴ 的子空间 $W$,使 $\mathbf{F}^4=U\oplus W$。
提示

$U$ 里的向量「第 2 个坐标跟着第 1 个、第 4 个跟着第 3 个」。让 $W$ 负责补上「第 2 个坐标与第 1 个的差」和「第 4 个与第 3 个的差」。

参考解答

取 $W=\{(0,s,0,t): s,t\in\mathbf{F}\}$。

和是全空间:$(a,b,c,d)=(a,a,c,c)+(0,\,b-a,\,0,\,d-c)$,前者在 $U$ 中、后者在 $W$ 中。

交只有 0:若 $(x,x,y,y)=(0,s,0,t)$,则 $x=0$、$s=x=0$、$y=0$、$t=y=0$。

由 1.46,$\mathbf{F}^4=U\oplus W$。(答案不唯一,例如 $\{(s,0,t,0)\}$ 也可以。)

1C.23证明或举反例:若 $V_1,V_2,U$ 是 $V$ 的子空间,且 $V=V_1\oplus U$、$V=V_2\oplus U$,则 $V_1=V_2$。
提示

原书提示:判断线性代数中的猜想时,先在 𝐅² 中做实验。想想 ℝ³ 演示中的预设 e。

参考解答

命题错误。在 $V=\mathbf{F}^2$ 中取 $U=\{(x,0)\}$(x 轴),$V_1=\{(0,y)\}$(y 轴),$V_2=\{(y,y)\}$(直线 $y=x$)。

$(a,b)=(0,b)+(a,0)$ 且 $V_1\cap U=\{0\}$,所以 $V=V_1\oplus U$;$(a,b)=(b,b)+(a-b,0)$,且 $(y,y)=(x,0)$ 推出 $y=0$、$x=0$,所以 $V_2\cap U=\{0\}$,$V=V_2\oplus U$。但 $V_1\neq V_2$。

也就是说:一个子空间的「补空间」不唯一(与第 6 章唯一的正交补不同)。

1C.24称 $f:\mathbf{R}\to\mathbf{R}$ 为偶函数,若 $f(-x)=f(x)$ 对所有 $x$ 成立;为奇函数,若 $f(-x)=-f(x)$ 对所有 $x$ 成立。记 $V_e$、$V_o$ 分别为全体实值偶函数、奇函数的集合。证明 $\mathbf{R}^{\mathbf{R}}=V_e\oplus V_o$。
提示

把 $f(x)$ 与 $f(-x)$ 取平均、取半差。然后用 1.46。

参考解答

子空间:零函数既偶又奇;偶函数之和、偶函数的倍数仍是偶函数;奇函数同理。由 1.34,$V_e$、$V_o$ 都是子空间。

和:对任意 $f$,令 $f_e(x)=\frac{f(x)+f(-x)}{2}$,$f_o(x)=\frac{f(x)-f(-x)}{2}$。直接验证 $f_e$ 为偶、$f_o$ 为奇,且 $f=f_e+f_o$,所以 $\mathbf{R}^{\mathbf{R}}=V_e+V_o$。

交:若 $g\in V_e\cap V_o$,则 $g(x)=g(-x)=-g(x)$,故 $g(x)=0$ 对所有 $x$ 成立,$V_e\cap V_o=\{0\}$。

由 1.46,$\mathbf{R}^{\mathbf{R}}=V_e\oplus V_o$。∎(上面的「偶部 + 奇部」演示画的正是这个分解。)

第 2 章

有限维向量空间 Finite-Dimensional Vector Spaces

有限个向量就能「铺满」的空间,才是线性代数真正的主角。本章找出铺满空间最省的方式——基,并证明需要的向量个数——维数——是空间本身的属性,与怎么选基无关。

学习目标
  • 把「线性组合」「张成」理解成「沿几个方向走,能走到哪里」,能在 ℝ² / ℝ³ 中画出张成:原点、直线、平面、整个空间。
  • 理解线性无关的三种等价说法:只有全零系数能组合出 0;表示法唯一;每个向量都带来一个新方向。
  • 会用线性相关引理 2.19 找出并删掉多余的向量,看懂核心不等式 2.22 的「替换」证明。
  • 理解「基 = 坐标系」;会把张成组删成基、把线性无关组扩充成基,并为子空间找到直和补。
  • 理解维数为什么定义得好,会用「长度等于维数时只需检查一半」和维数公式 2.43 解题。
一分钟速览
  • 线性组合就是按系数把几个向量加起来;张成(span)是全部线性组合的集合,也是包含这些向量的最小子空间。
  • 有限维 = 有限个向量就能张成整个空间。$\mathcal{P}_m(\mathbf{F})$ 是有限维的,全体多项式 $\mathcal{P}(\mathbf{F})$ 是无限维的。
  • 线性无关 = 只有全零系数能组合出 0 = 每个向量的写法唯一 = 没有哪个向量落在它前面那些向量的张成里。
  • 线性相关引理:相关组里总有一个向量落在它前面向量的张成里,删掉它,张成不变——这是本章的万能工具。
  • 核心不等式:线性无关组的长度 ≤ 张成组的长度(每放进一个无关向量,就能踢出一个张成向量)。
  • 基 = 线性无关 + 张成 = 坐标系:每个向量都有唯一的坐标。张成组可以删成基,线性无关组可以扩充成基。
  • 维数 = 任意一组基的长度(所有基一样长)。$\dim\mathbf{F}^n=n$,$\dim\mathcal{P}_m(\mathbf{F})=m+1$;长度恰为 $\dim V$ 的组:线性无关 ⟺ 张成 ⟺ 是基。
  • 维数公式:$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$,和集合计数的容斥原理如出一辙。
本章地图 2A 2B 2C 张成 span2.4 · 有限维 2.9 线性无关2.15 写法唯一 线性相关引理2.19 多余向量可删 无关组 ≤ 张成组2.22 核心不等式 基 basis2.26 无关 + 张成 唯一的坐标2.28 基的判定 张成组删成基2.30 · 2.31 无关组扩成基2.32 → 直和补 2.33 所有基一样长2.34 维数 dim V2.35 · 2.37 长度对只查一半2.38 · 2.42 维数公式2.43 ≈ 容斥原理

点击方框跳到对应小节。实线箭头:「推出 / 用到」;虚线:扩充成基(2.32)是维数公式 2.43 证明的关键一步。

本章约定 (standing assumptions for this chapter)
  • 𝐅 表示 ℝ 或 ℂ;
  • $V$ 表示 𝐅 上的一个向量空间。

小插曲:本章标题与 Paul Halmos 1942 年的名著 Finite-Dimensional Vector Spaces 完全相同——那是第一本现代风格的线性代数教材,写于普林斯顿高等研究院(原书本章首页的照片就是那座主楼)。

2A 张成与线性无关 Span and Linear Independence

第 1 章给出了向量空间的「游戏规则」,这一章开始研究空间的「形状」。本节回答两个朴素的问题:

  • 够不够?给定几个向量,只用加法和数乘,能「到达」空间里的哪些向量?——这就是张成。
  • 省不省?这几个向量里有没有「多余」的、删掉也不影响到达范围的?——没有多余,就叫线性无关。

「够用」而又「不浪费」的向量组,就是下一节的主角——基。

记号:向量组 (notation: list of vectors) 2.1 第 1 章说过,组(list)是有限长、有顺序、允许重复的序列。𝐅ⁿ 的元素本身就是「数的组」,写成 $(2,-7,8)$ 这样带括号的形式;为了不混淆,向量组通常不加括号:例如 $(4,1,6),\,(9,5,7)$ 表示 ℝ³ 中一个长度为 2 的向量组。顺序和重复都算数——$v, v$ 是长度为 2 的组。

线性组合与张成 Linear Combinations and Span

直觉 把每个向量想成一种「走法」。线性组合 $a_1v_1+\dots+a_mv_m$ 就是:沿 $v_1$ 走 $a_1$ 倍,再沿 $v_2$ 走 $a_2$ 倍……最后停下的位置。系数可以取任何数——负数表示反着走,0 表示这一步不走。张成就是用这些走法能到达的所有位置。
定义线性组合linear combination2.2

$V$ 中向量组 $v_1,\dots,v_m$ 的一个线性组合,是形如 $a_1v_1+\dots+a_mv_m$ 的向量,其中 $a_1,\dots,a_m\in\mathbf{F}$。

例ℝ³ 中的线性组合linear combinations in R³2.3

• $(17,-4,2)$ 是 $(2,1,-3),\,(1,-2,4)$ 的线性组合,因为 $(17,-4,2)=6(2,1,-3)+5(1,-2,4)$。

• $(17,-4,5)$ 不是它们的线性组合:若 $(17,-4,5)=a_1(2,1,-3)+a_2(1,-2,4)$,由前两个分量 $2a_1+a_2=17$、$a_1-2a_2=-4$ 只能解出 $a_1=6,\ a_2=5$,可第三个分量 $-3\cdot6+4\cdot5=2\ne5$——方程组无解。

几何上看:$(2,1,-3)$ 与 $(1,-2,4)$ 不共线,它们的全部线性组合铺成 ℝ³ 中一个过原点的平面。$(17,-4,2)$ 恰好在这个平面上,$(17,-4,5)$ 不在——再怎么调系数也够不到。

先在平面上亲手试一试:用两个向量的线性组合去「够」一个目标点。

线性组合:调系数去「够」目标点 w

拖动蓝色 $v_1$、红色 $v_2$ 的箭头尖端和黄色空心目标点 $w$(都会吸附到 0.5 的格点);拖动滑块改变系数 $a,b$,紫色点 $av_1+bv_2$ 随之移动(虚线就是「先走 $av_1$ 再走 $bv_2$」)。点「求解」自动对准 $w$;点「撒点」看看全部线性组合铺成什么形状。

只要 $v_1,v_2$ 不共线,任何 $w$ 都够得到,而且系数只有一组;撒下的点铺成二维的一整片(系数取得越大,铺得越远,最终铺满整个平面)。一旦把 $v_2$ 拖到 $v_1$ 所在的直线上(或点「让 v₂ 与 v₁ 共线」),点云立刻塌成一条直线:直线外的 $w$ 永远够不到,直线上的 $w$ 却有无穷多种写法。「够不够得到」是张成的问题,「写法唯不唯一」是线性无关的问题——这正是本节的两条主线。

定义张成span2.4

$V$ 中向量组 $v_1,\dots,v_m$ 的全部线性组合构成的集合,叫作这个组的张成,记作 $\operatorname{span}(v_1,\dots,v_m)$:

$$\operatorname{span}(v_1,\dots,v_m)=\{a_1v_1+\dots+a_mv_m : a_1,\dots,a_m\in\mathbf{F}\}.$$

约定:空组 $(\ )$ 的张成是 $\{0\}$。(有些书叫它线性张成 linear span,意思相同。)

用这个记号,例 2.3 说的就是 2.5:$(17,-4,2)\in\operatorname{span}\big((2,1,-3),(1,-2,4)\big)$,而 $(17,-4,5)\notin\operatorname{span}\big((2,1,-3),(1,-2,4)\big)$。

定理张成是包含这组向量的最小子空间span is the smallest containing subspace2.6

$V$ 中一个向量组的张成,是 $V$ 中包含这个组所有向量的最小子空间。

证明思路

(1) 张成是子空间(用 1.34 的三条检验):$0=0v_1+\dots+0v_m$ 在张成里;两个线性组合相加,系数对应相加,仍是线性组合:$(a_1v_1+\dots+a_mv_m)+(c_1v_1+\dots+c_mv_m)=(a_1+c_1)v_1+\dots+(a_m+c_m)v_m$;乘一个数 $\lambda$,系数都乘 $\lambda$,也仍是线性组合。

(2) 它是最小的:每个 $v_k$ 都在张成里(取 $a_k=1$,其余系数取 0)。反过来,任何包含所有 $v_k$ 的子空间都对加法和数乘封闭,必然包含它们的一切线性组合,也就包含整个张成。

直觉 「最小」的意思是:张成不多不少。它包含那些向量、本身是子空间,而任何满足这两点的子空间都至少和它一样大。所以在 ℝ³ 里,两个不共线向量的张成恰好是「过原点、包含它们的那个平面」,一个非零向量的张成恰好是「过原点、沿它方向的直线」。
定义张成(空间)spans2.7

如果 $\operatorname{span}(v_1,\dots,v_m)=V$,就说组 $v_1,\dots,v_m$ 张成 $V$。

例张成 𝐅ⁿ 的组a list that spans Fⁿ2.8

$(1,0,\dots,0),\,(0,1,0,\dots,0),\,\dots,\,(0,\dots,0,1)$(第 $k$ 个向量的第 $k$ 个位置是 1,其余是 0)张成 𝐅ⁿ,因为任何 $(x_1,\dots,x_n)$ 都能写成 $x_1(1,0,\dots,0)+x_2(0,1,0,\dots,0)+\dots+x_n(0,\dots,0,1)$。

现在可以给出线性代数里最关键的定义之一。

定义有限维向量空间finite-dimensional vector space2.9

如果某个向量组张成一个向量空间,就称这个向量空间是有限维的。

别忘了按定义「组」都是有限长的,所以有限维的意思就是:有限个向量就能张成整个空间。由例 2.8,对每个正整数 $n$,𝐅ⁿ 都是有限维的。

多项式是另一个重要的例子。

定义多项式、𝒫(𝐅)polynomial, 𝒫(F)2.10

函数 $p:\mathbf{F}\to\mathbf{F}$ 称为(系数在 𝐅 中的)多项式,如果存在 $a_0,\dots,a_m\in\mathbf{F}$,使得对所有 $z\in\mathbf{F}$ 都有 $p(z)=a_0+a_1z+a_2z^2+\dots+a_mz^m$。全体这样的多项式记作 $\mathcal{P}(\mathbf{F})$。

按通常的加法和数乘,$\mathcal{P}(\mathbf{F})$ 是 𝐅 上的向量空间,它是函数空间 $\mathbf{F}^{\mathbf{F}}$ 的子空间。多项式的系数由多项式(作为函数)唯一确定:若两组系数给出同一个函数,相减就得到一个恒等于 0 的多项式,而它的系数必须全为 0(原书在 4.8 证明这一点,这里先承认它)。所以下面的「次数」是良定义的。

定义多项式的次数degree of a polynomial, deg p2.11

若存在 $a_0,\dots,a_m\in\mathbf{F}$ 且 $a_m\ne0$,使得对所有 $z$ 有 $p(z)=a_0+a_1z+\dots+a_mz^m$,就说 $p$ 的次数是 $m$,记作 $\deg p=m$。恒为 0 的多项式,次数规定为 $-\infty$。

定义记号 𝒫ₘ(𝐅)notation: 𝒫ₘ(F)2.12

对非负整数 $m$,$\mathcal{P}_m(\mathbf{F})$ 表示系数在 𝐅 中、次数不超过 $m$ 的多项式全体(约定 $-\infty\lt m$,所以零多项式也在其中)。

显然 $\mathcal{P}_m(\mathbf{F})=\operatorname{span}(1,z,\dots,z^m)$(这里稍微滥用记号,用 $z^k$ 表示函数 $z\mapsto z^k$),所以每个 $\mathcal{P}_m(\mathbf{F})$ 都是有限维的。

定义无限维向量空间infinite-dimensional vector space2.13

不是有限维的向量空间称为无限维的。

例𝒫(𝐅) 是无限维的𝒫(F) is infinite-dimensional2.14

任取 $\mathcal{P}(\mathbf{F})$ 中的一个组,设其中多项式的最高次数是 $m$。那么这个组张成出来的每个多项式,次数都不超过 $m$——于是 $z^{m+1}$ 不在张成里。没有任何组能张成 $\mathcal{P}(\mathbf{F})$,所以它是无限维的。

常见误区:「无限维」≠「元素有无穷多个」 ℝ² 也有无穷多个元素,但两个向量就能张成它,所以是有限维的。无限维的意思是:任何有限个向量都张不满。$\mathcal{P}(\mathbf{F})$ 正是如此——有限个多项式的次数总有上限,更高次的多项式够不到。

在 ℝ³ 中,两个不共线的向量 $v_1,v_2$ 的张成是什么?

线性无关 Linear Independence

设 $v\in\operatorname{span}(v_1,\dots,v_m)$,那么 $v$ 能写成 $a_1v_1+\dots+a_mv_m$。自然要问:写法唯一吗?假如还有另一种写法 $v=c_1v_1+\dots+c_mv_m$,两式相减得到

$$0=(a_1-c_1)v_1+\dots+(a_m-c_m)v_m.$$

也就是说,我们把 0 写成了 $v_1,\dots,v_m$ 的线性组合。如果把 0 写成线性组合只有「系数全取 0」这一种办法,那么每个 $a_k-c_k=0$,写法就唯一了。这个性质重要到值得一个专门的名字。

定义线性无关linearly independent2.15

• $V$ 中的组 $v_1,\dots,v_m$ 称为线性无关的,如果使 $a_1v_1+\dots+a_mv_m=0$ 成立的唯一选择是 $a_1=\dots=a_m=0$。

• 空组 $(\ )$ 也规定为线性无关的。

上面的推理说明:$v_1,\dots,v_m$ 线性无关 ⟺ $\operatorname{span}(v_1,\dots,v_m)$ 中每个向量都只有一种写法。

直觉:线性无关的三种说法
  • 代数:只有全零系数能组合出 0。
  • 唯一性:张成里每个向量的「配方」(系数)只有一种。
  • 几何:逐个看过去,每个向量都带来一个前面没有的新方向,没有一个是多余的(这一点由下面的线性相关引理说清楚)。
例线性无关的组linearly independent lists2.16

(a) $(1,0,0,0),(0,1,0,0),(0,0,1,0)$ 在 𝐅⁴ 中线性无关:$a_1(1,0,0,0)+a_2(0,1,0,0)+a_3(0,0,1,0)=(a_1,a_2,a_3,0)$,它等于 0 只能 $a_1=a_2=a_3=0$。

(b) 对非负整数 $m$,$1,z,\dots,z^m$ 在 $\mathcal{P}(\mathbf{F})$ 中线性无关:若 $a_0+a_1z+\dots+a_mz^m$ 对所有 $z$ 都等于 0,则所有系数为 0(4.8)。

(c) 长度为 1 的组线性无关 ⟺ 那个向量不是 0。

(d) 长度为 2 的组线性无关 ⟺ 两个向量都不是对方的数量倍(几何上:不共线)。

从线性无关组里删掉一些向量,剩下的组仍然线性无关(不妨自己验证一下)。

定义线性相关linearly dependent2.17

不线性无关的组称为线性相关的。换句话说:存在不全为 0 的 $a_1,\dots,a_m\in\mathbf{F}$ 使 $a_1v_1+\dots+a_mv_m=0$。

例线性相关的组linearly dependent lists2.18

• $(2,3,1),(1,-1,2),(7,3,8)$ 在 𝐅³ 中线性相关,因为 $2(2,3,1)+3(1,-1,2)+(-1)(7,3,8)=(0,0,0)$。

• $(2,3,1),(1,-1,2),(7,3,c)$ 线性相关 ⟺ $c=8$(习题 2A.6)。

• 如果组中某个向量是其他向量的线性组合,这个组就线性相关(把它移到等式另一边,它的系数是 $-1\ne0$)。

• 含零向量的组一定线性相关(上一条的特例)。

常见误区
  • 「两两不共线」≠ 线性无关。$(1,0,0),(0,1,0),(1,1,0)$ 两两都不共线,却都躺在 $xy$ 平面里:$(1,1,0)=(1,0,0)+(0,1,0)$,所以线性相关。
  • 线性相关 ≠「每个向量都能由其余向量表示」。$(1,0),(2,0),(0,1)$ 线性相关,但 $(0,1)$ 并不是另外两个的组合。相关只保证至少有一个是多余的。
  • 线性无关是整个组的性质,不是单个向量的性质;它和顺序无关,却和重复有关:$v,v$ 总是线性相关的。
  • 它还和 𝐅 有关:$1+i,\,1-i$ 把 ℂ 看成 ℝ 上的空间时线性无关,看成 ℂ 上的空间时线性相关(习题 2A.7)。

下面这个引理是本章最好用的工具。它说:在线性相关的组里,一定有某个向量落在它前面那些向量的张成里;并且把它删掉,张成不变。

引理线性相关引理linear dependence lemma2.19

设 $v_1,\dots,v_m$ 是 $V$ 中线性相关的组。那么存在 $k\in\{1,2,\dots,m\}$,使得

$$v_k\in\operatorname{span}(v_1,\dots,v_{k-1}).$$

并且,如果 $k$ 满足上面的条件,把第 $k$ 项从组中删去,剩下的组的张成仍等于 $\operatorname{span}(v_1,\dots,v_m)$。

证明思路

找到 $k$:因为线性相关,存在不全为 0 的 $a_1,\dots,a_m$ 使 $a_1v_1+\dots+a_mv_m=0$。取 $k$ 为使 $a_k\ne0$ 的最大下标(它后面的系数全是 0),就能把 $v_k$ 解出来:

$$v_k=-\frac{a_1}{a_k}v_1-\dots-\frac{a_{k-1}}{a_k}v_{k-1},$$

所以 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$。

删掉不影响张成:设 $k$ 满足条件,写 $v_k=b_1v_1+\dots+b_{k-1}v_{k-1}$ 2.20。任取 $u=c_1v_1+\dots+c_mv_m\in\operatorname{span}(v_1,\dots,v_m)$,把其中的 $v_k$ 换成右边这个表达式,$u$ 就写成了不含 $v_k$ 的线性组合。所以删掉 $v_k$ 后,能到达的向量一个也没少。

特殊情形 $k=1$:条件变成 $v_1\in\operatorname{span}(\ )=\{0\}$,即 $v_1=0$。(原书提醒:以后涉及空组、$\{0\}$ 之类的平凡情形,证明常需小改,请自行检查。)

直觉:一个一个地加 把组里的向量按顺序逐个放进来:$v_1$ 张成一条线,$v_2$ 如果不在线上就把它扩成一个平面……第一次出现「没带来新方向」的向量——它落在前面向量已经张成的范围里——它就是引理里的 $v_k$。它是多余的:前面的向量本来就能到达它能帮忙到达的一切。
反过来读就是一个常用判据:如果组中没有任何向量落在它前面向量的张成里,这个组就线性无关(后面 2.25、2.30 的证明都用这句话)。
例线性相关引理中最小的 ksmallest k in linear dependence lemma2.21

考虑 ℝ³ 中的组 $(1,2,3),(6,5,4),(15,16,17),(8,9,7)$。它长度为 4,马上会看到(例 2.23)它一定线性相关。引理中最小的 $k$ 是几?

• $k=1$ 不行:$(1,2,3)\ne0$。
• $k=2$ 不行:$(6,5,4)$ 不是 $(1,2,3)$ 的倍数。
• $k=3$ 行:解 $(15,16,17)=a(1,2,3)+b(6,5,4)$(三个方程、两个未知数)得 $a=3,\ b=2$。所以最小的 $k=3$。

在三维空间里看,张成与线性相关就一目了然了。下面的演示可以旋转、可以拖动向量,读数会实时告诉你引理中的 $k$。

ℝ³ 中的张成与线性相关引理(可旋转)

在空白处拖动可旋转视角;拖动箭头尖端可移动向量(沿屏幕所在的方向移动,配合旋转就能放到任何位置)。勾选 v₁–v₄ 决定组里有哪些向量,青色图形是它们的张成。当一个向量靠近其余向量张成的直线/平面时,会被「吸」进去。

1 个非零向量张成直线,2 个不共线的向量张成平面,3 个不共面的向量张成整个 ℝ³(图中用半透明立方体示意「充满空间」)。选「v₃ 落在 v₁, v₂ 的平面里」:组线性相关,读数给出 $v_3$ 用 $v_1,v_2$ 的表示;点「按引理删掉多余向量」,张成的形状纹丝不动。再选「四个向量」:ℝ³ 里的 4 个向量无论怎么拖都线性相关——这就是下面的 2.23。

现在来到本章的关键结果:线性无关组不可能比张成组更长。

定理线性无关组的长度 ≤ 张成组的长度length of linearly independent list ≤ length of spanning list2.22

在有限维向量空间中,每个线性无关组的长度都小于或等于每个张成组的长度。

直觉:替换 张成组 $w_1,\dots,w_n$ 像 $n$ 个「名额」,一起覆盖了整个空间;无关组 $u_1,\dots,u_m$ 的每个成员都需要一个独立的方向。证明的办法是逐个替换:把 $u$ 一个个放进张成组,每放进一个 $u$,组就变得线性相关,引理保证能踢出一个 $w$(绝不会是 $u$),而组仍然张成 $V$。$w$ 永远不会先被踢光,所以 $m\le n$。下面的小游戏就是这个证明本身。
替换游戏:每放进一个 u,就踢出一个 w(2.22 的证明)

$B=w_1,w_2,w_3,w_4$ 张成 ℝ³;$u_1,u_2,u_3$ 线性无关。点「放入下一个 u」,然后点一张绿色卡片把它删掉——绿色表示它落在自己前面那些向量的张成里,删掉不影响张成。也可以点红色卡片或蓝色的 u 卡片,看看为什么它们不能删。

每次删掉的都是「前面的向量已经能表示」的 $w$,所以 $B$ 始终张成 ℝ³,长度始终是 4。关键在于:放入 $u$ 后组一定线性相关,而多余的那个不可能是 $u$($u$ 们线性无关),所以每一步都至少还剩一个 $w$ 可删。第 1 步里 $w_4$ 删不掉:它前面的向量都在 $xy$ 平面上,只有它伸向 $z$ 方向。三步之后 3 个 $u$ 全部换入,还剩 1 个 $w$:$3\le4$。

2.22 的完整证明(替换论证)

设 $u_1,\dots,u_m$ 在 $V$ 中线性无关,$w_1,\dots,w_n$ 张成 $V$。要证 $m\le n$。下面的过程共 $m$ 步,每一步加入一个 $u$、删掉一个 $w$。

第 1 步:令 $B=w_1,\dots,w_n$,它张成 $V$。在它前面放上 $u_1$:因为 $u_1$ 是 $w$ 们的线性组合,组 $u_1,w_1,\dots,w_n$ 线性相关。由线性相关引理,其中某个向量落在它前面向量的张成里。它不是 $u_1$——因为 $u_1\ne0$($u$ 们线性无关),不在空组的张成 $\{0\}$ 里。所以可以删掉某个 $w$,得到新的 $B$(由 $u_1$ 和剩下的 $w$ 组成,长度仍为 $n$),它仍张成 $V$。

第 $k$ 步($k=2,\dots,m$):上一步的 $B$(长度 $n$)张成 $V$,所以 $u_k\in\operatorname{span}(B)$。把 $u_k$ 放在 $u_1,\dots,u_{k-1}$ 之后,得到长度 $n+1$ 的线性相关组。由引理,其中某个向量落在它前面向量的张成里;因为 $u_1,\dots,u_k$ 线性无关,这个向量不可能是某个 $u$。因此此时一定还剩至少一个 $w$,并且可以删掉这样一个 $w$,得到由 $u_1,\dots,u_k$ 和剩下的 $w$ 组成的新 $B$(长度 $n$),它仍张成 $V$。

第 $m$ 步之后,所有 $u$ 都加进来了。每加入一个 $u$,引理都保证有一个 $w$ 可删,所以 $w$ 至少和 $u$ 一样多:$m\le n$。∎

这个结果可以不做任何计算就判断某些组不线性无关、某些组张成不了空间:

例ℝ³ 中没有长度为 4 的线性无关组no list of length 4 is linearly independent in R³2.23

$(1,0,0),(0,1,0),(0,0,1)$ 张成 ℝ³、长度为 3,所以 ℝ³ 中长度大于 3 的组都不线性无关。例如 $(1,2,3),(4,5,8),(9,6,7),(-3,2,8)$ 不用算就知道线性相关。

例长度为 3 的组张成不了 ℝ⁴no list of length 3 spans R⁴2.24

$(1,0,0,0),\dots,(0,0,0,1)$ 在 ℝ⁴ 中线性无关、长度为 4,所以长度小于 4 的组都张成不了 ℝ⁴。例如 $(1,2,3,-5),(4,5,8,3),(9,6,7,-1)$ 张成不了 ℝ⁴。

直觉告诉我们:有限维空间的子空间也应该是有限维的。这是对的,但需要 2.22 来保证。

定理有限维空间的子空间是有限维的finite-dimensional subspaces2.25

有限维向量空间的每个子空间都是有限维的。

证明思路:不断往 U 里挑新方向

设 $V$ 有限维,$U$ 是 $V$ 的子空间。第 1 步:若 $U=\{0\}$,它有限维,结束;否则挑一个非零向量 $u_1\in U$。第 $k$ 步:若 $U=\operatorname{span}(u_1,\dots,u_{k-1})$,它有限维,结束;否则挑一个 $u_k\in U$ 使 $u_k\notin\operatorname{span}(u_1,\dots,u_{k-1})$。

只要过程还在继续,挑出的组里就没有向量落在它前面向量的张成里,由线性相关引理,它是线性无关的。而由 2.22,线性无关组不能比 $V$ 的某个张成组更长——所以过程必然在有限步内停下,此时 $U$ 被有限个向量张成。

下面哪个组在 ℝ² 中线性相关?

ℝ³ 中三个向量两两都不共线(任意两个都不平行)。关于这三个向量组成的组,下面哪个说法正确?

组 $v_1,\dots,v_5$ 线性相关。线性相关引理保证的是什么?

向量组list of vectors有限长、有顺序、允许重复的一串向量,如 $v_1,\dots,v_m$;书写时通常不加括号。
线性组合linear combination形如 $a_1v_1+\dots+a_mv_m$ 的向量:沿每个 $v_k$ 走 $a_k$ 倍后到达的位置。
张成span全部线性组合的集合 $\operatorname{span}(v_1,\dots,v_m)$,是包含这些向量的最小子空间;$\operatorname{span}(\ )=\{0\}$。
张成 Vspans若 $\operatorname{span}(v_1,\dots,v_m)=V$,就说这个组张成 $V$(它是 $V$ 的张成组)。
有限维finite-dimensional存在一个(有限长的)组张成整个空间,例如 𝐅ⁿ、$\mathcal{P}_m(\mathbf{F})$。
无限维infinite-dimensional不是有限维:任何有限个向量都张不满,例如全体多项式 $\mathcal{P}(\mathbf{F})$。
多项式的次数degree of a polynomial最高非零系数对应的幂次;零多项式的次数规定为 $-\infty$。$\mathcal{P}_m(\mathbf{F})$ 是次数 $\le m$ 的多项式全体。
线性无关linearly independent只有全零系数能组合出 0 ⟺ 张成中每个向量的写法唯一;空组也算线性无关。
线性相关linearly dependent存在不全为 0 的系数使 $a_1v_1+\dots+a_mv_m=0$;含零向量或有重复的组一定相关。
线性相关引理linear dependence lemma相关组中存在 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$,删掉它张成不变(2.19)。
本节要点
  • 张成 = 所有线性组合 = 包含这些向量的最小子空间;有限维 = 有限个向量就能张成。
  • 线性无关 = 表示法唯一 = 每个向量都带来新方向;相关组里总能按引理删掉一个多余向量而不改变张成。
  • 核心不等式 2.22:无关组长度 ≤ 张成组长度。它推出 2.23、2.24、2.25;到 2C 还要用它推出「所有基一样长」。

2B 基 Bases

上一节有两个概念:张成组(够用)和线性无关组(不浪费)。本节把它们合二为一:既线性无关、又张成 $V$ 的组,就是基。基就是空间的一套坐标系——每个向量都能用它唯一地写出来,那组系数就是这个向量的坐标。

定义基basis2.26

$V$ 的一组基,是 $V$ 中一个线性无关并且张成 $V$ 的向量组。

直觉:刚刚好 基是「刚刚好」的向量组:再少一个就张不满(不够),再多一个就线性相关(浪费)。张成保证每个向量都能写出来,线性无关保证写法唯一——两者合起来,就是坐标。
例基的例子bases2.27
向量组所在空间线性无关张成是基
(a)$(1,0,\dots,0),\dots,(0,\dots,0,1)$𝐅ⁿ✓✓✓ 称为 𝐅ⁿ 的标准基
(b)$(1,2),\,(3,5)$𝐅²✓✓✓(长度 2,和标准基一样长——不是巧合,见 2C)
(c)$(1,2,-4),\,(7,-5,6)$𝐅³✓✗✗
(d)$(1,2),\,(3,5),\,(4,13)$𝐅²✗✓✗
(e)$(1,1,0),\,(0,0,1)$$\{(x,x,y)\in\mathbf{F}^3: x,y\in\mathbf{F}\}$✓✓✓
(f)$(1,-1,0),\,(1,0,-1)$$\{(x,y,z)\in\mathbf{F}^3: x+y+z=0\}$✓✓✓
(g)$1,z,\dots,z^m$$\mathcal{P}_m(\mathbf{F})$✓✓✓ 称为 $\mathcal{P}_m(\mathbf{F})$ 的标准基

除了标准基,𝐅ⁿ 还有许多别的基。例如 $(7,5),(-4,9)$ 和 $(1,2),(3,5)$ 都是 𝐅² 的基。

下面的结果说明基为什么有用。回忆「唯一地」就是「只有一种方式」。

定理基的判定准则criterion for basis2.28

组 $v_1,\dots,v_n$ 是 $V$ 的基,当且仅当每个 $v\in V$ 都能唯一地写成

$$v=a_1v_1+\dots+a_nv_n,\qquad a_1,\dots,a_n\in\mathbf{F}.$$(2.29)
证明思路

这几乎就是引出「线性无关」时那段推理的重复。(⇒) 张成 ⇒ 每个 $v$ 都能写成 (2.29);若还有 $v=c_1v_1+\dots+c_nv_n$,两式相减得 $0=(a_1-c_1)v_1+\dots+(a_n-c_n)v_n$,线性无关 ⇒ 每个 $a_k=c_k$,写法唯一。

(⇐) 每个 $v$ 都能写 ⇒ 组张成 $V$。取 $v=0$:$0=0v_1+\dots+0v_n$ 是一种写法,由唯一性它是唯一的写法,所以 $a_1v_1+\dots+a_nv_n=0$ 只能 $a_1=\dots=a_n=0$,即线性无关。

直觉:基 = 坐标系 一旦选定基 $v_1,\dots,v_n$,$V$ 中每个向量就对应唯一的一串数 $(a_1,\dots,a_n)$——它在这组基下的坐标。换一组基,同一个向量的坐标就变了,就像同一个地点可以用不同的地图网格来描述。第 3 章会把这件事发展成「矩阵」和「基变换」。
基 = 坐标系:同一个向量,两套坐标

浅灰色细网格是标准基 $e_1,e_2$ 的坐标网格;紫色网格由基 $b_1$(蓝)、$b_2$(红)铺成,它的格点就是 $b_1,b_2$ 的整数倍组合。拖动 $b_1$、$b_2$ 的尖端和黄色点 $v$(吸附到 0.5 格点),读出 $v$ 在两套坐标系下的坐标。彩色虚线是「先走 $a\,b_1$、再走 $b\,b_2$」,灰色点线是「先走 $x\,e_1$、再走 $y\,e_2$」。

坐标就是「沿每个基向量走几步」。换一组基,网格变了,同一个点的坐标也跟着变——点本身却没动。把 $b_2$ 拖到与 $b_1$ 共线(或选「共线」预设):紫色网格塌成一条线。线外的 $v$ 根本写不出来(不张成),线上的 $v$ 写法有无穷多种(不无关)。基的两个条件,恰好对应「写得出来」与「写法唯一」——这就是 2.28。

在基 $(1,1),\,(1,-1)$ 下,向量 $(5,1)$ 的坐标是多少?

张成组可以删成基

张成组可能不是基,因为它可能线性相关。下面的结果说:总能从中删掉一些向量(也可能一个都不删),使剩下的组线性无关而且仍然张成空间。方法像一个筛子:从左到右逐个检查,落在前面向量张成里的就删掉。例如在 𝐅² 中对 $(1,2),(3,6),(4,7),(5,9)$ 做这件事,第二个和第四个会被删掉,剩下的 $(1,2),(4,7)$ 是 𝐅² 的基。

定理每个张成组都包含一组基every spanning list contains a basis2.30

向量空间中的每个张成组都可以删减成该空间的一组基。

证明:逐个过筛

设 $v_1,\dots,v_n$ 张成 $V$。从 $B=v_1,\dots,v_n$ 出发:

第 1 步:若 $v_1=0$,从 $B$ 中删去 $v_1$;否则 $B$ 不变。
第 $k$ 步:若 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$,从 $B$ 中删去 $v_k$;否则 $B$ 不变。

做完第 $n$ 步得到组 $B$。它张成 $V$:原来的组张成 $V$,而我们删掉的都是已经落在前面向量张成里的向量(由引理 2.19,张成不变)。它线性无关:过程保证 $B$ 中没有向量落在它前面向量的张成里,由线性相关引理即得。所以 $B$ 是 $V$ 的基。

开始:张成组 (1,2), (3,6), (4,7), (5,9)

这 4 个向量张成 𝐅²,但 𝐅² 中长度为 4 的组不可能线性无关(2.22)——一定有多余的。从左到右逐个检查,每个向量只问一个问题:它在前面向量的张成里吗?

第 1 步:v₁ = (1,2) ≠ 0 → 保留

$v_1$ 前面是空组,张成只有 $\{0\}$;$v_1$ 不是 0,所以保留。现在保留的向量张成一条过原点的直线(青色)。

第 2 步:v₂ = (3,6) = 3·v₁ → 删去

$v_2$ 正好落在这条直线上:$v_2\in\operatorname{span}(v_1)$,没带来新方向,删掉它张成不变。

第 3 步:v₃ = (4,7) 不在直线上 → 保留

$(4,7)$ 不是 $(1,2)$ 的倍数,所以 $v_3\notin\operatorname{span}(v_1,v_2)=\operatorname{span}(v_1)$:直线上高度为 7 的点是 $(3.5,7)$,而 $v_3$ 的横坐标是 4(图中紫色虚线)。它和 $v_1$ 的方向只差约 3°——几乎共线,但「几乎」不算数:只要不精确落在直线上,就带来了新方向。保留它,张成从直线扩成了整个平面。

第 4 步:v₄ = (5,9) = v₁ + v₃ → 删去

平面已经被铺满,$v_4$ 必然多余。具体地,$(5,9)=(4,7)+(1,2)$:从 $v_3$ 的尖端再走一个 $v_1$(图中蓝色虚线箭头),正好到达 $v_4$。注意 $\operatorname{span}(v_1,v_2,v_3)=\operatorname{span}(v_1,v_3)$:检查「前面所有向量」和只检查「已保留的向量」是一回事。

结果:(1,2), (4,7) 是 𝐅² 的一组基

筛剩的组张成(只删了多余的),又线性无关(其中没有向量落在它前面向量的张成里)。长度是 2——和标准基一样长,这在 2C 会得到解释。

推论有限维向量空间都有基basis of finite-dimensional vector space2.31

每个有限维向量空间都有基。

证明

按定义,有限维空间有一个张成组;由 2.30,它可以删减成一组基。

线性无关组可以扩充成基

下面的结果在某种意义上是 2.30 的「对偶」:2.30 说张成组可以删成基;现在说线性无关组可以添一些向量(也可能一个都不添),变成仍然线性无关、而且张成空间的组。

定理每个线性无关组都能扩充成基every linearly independent list extends to a basis2.32

有限维向量空间中的每个线性无关组,都可以扩充成该空间的一组基。

证明:把张成组接在后面,再过一遍筛子

设 $u_1,\dots,u_m$ 在有限维空间 $V$ 中线性无关,$w_1,\dots,w_n$ 张成 $V$。那么组 $u_1,\dots,u_m,w_1,\dots,w_n$ 也张成 $V$。对它施行 2.30 证明中的筛选过程,得到 $V$ 的一组基。$u$ 一个也不会被删:$u$ 们线性无关,任何 $u_k$ 都不在 $\operatorname{span}(u_1,\dots,u_{k-1})$ 中。所以得到的基由全部 $u$ 和一部分 $w$ 组成。

例如在 𝐅³ 中,从线性无关组 $(2,3,4),(9,6,8)$ 出发,把标准基 $(1,0,0),(0,1,0),(0,0,1)$ 接在后面过筛,得到基 $(2,3,4),(9,6,8),(0,1,0)$。有点意外的是 $(1,0,0)$ 被筛掉了——在下面的演示里亲眼看看为什么。

筛子:把向量组筛成基(ℝ³,可旋转)

选一个预设,或者输入自己的向量组(每个向量 3 个数,向量之间用分号隔开),再逐次点「下一步」:落在前面向量张成里的向量被删去(红色虚线),其余保留(实线)。青色图形是已保留向量的张成。为了看得清,箭头只画方向(长度统一)——张成只与方向有关。拖动空白处可旋转。

默认的「2.32」预设:$(2,3,4)$ 与 $(9,6,8)$ 张成的平面恰好包含 $x$ 轴,所以 $(1,0,0)=-\tfrac25(2,3,4)+\tfrac15(9,6,8)$ 被删去,$(0,1,0)$ 才是真正的新方向(紫色虚线标出它「伸出」原来那个平面的部分)。筛子只保留带来新方向的向量,而开头的线性无关组一个也不会被删——这正是 2.32 的证明。「例 2.21」预设:第 3 步删去 $(15,16,17)=3(1,2,3)+2(6,5,4)$;$(8,9,7)$ 只偏离那个平面约 5°,却已足够带来新方向。「只张成一个平面」预设说明:筛出来的是张成空间的基——这里是一个平面的基,长度为 2。

子空间都有直和补

作为 2.32 的应用,有限维空间的每个子空间都能和另一个子空间「拼」成整个空间的直和。

定理V 的每个子空间都是某个等于 V 的直和的一部分every subspace of V is part of a direct sum equal to V2.33

设 $V$ 有限维,$U$ 是 $V$ 的子空间。那么存在 $V$ 的子空间 $W$,使得 $V=U\oplus W$。

证明思路:把 U 的基扩充成 V 的基,新添的部分张成 W

由 2.25,$U$ 有限维,所以有基 $u_1,\dots,u_m$(2.31)。它在 $V$ 中线性无关,可以扩充成 $V$ 的基 $u_1,\dots,u_m,w_1,\dots,w_n$(2.32)。令 $W=\operatorname{span}(w_1,\dots,w_n)$。由 1.46,只需证明 $V=U+W$ 且 $U\cap W=\{0\}$。

$V=U+W$:任取 $v\in V$,用整组基把它写出来,前一半在 $U$ 里、后一半在 $W$ 里:

$$v=\underbrace{a_1u_1+\dots+a_mu_m}_{u\,\in\,U}+\underbrace{b_1w_1+\dots+b_nw_n}_{w\,\in\,W}.$$

$U\cap W=\{0\}$:若 $v$ 同时在 $U$ 和 $W$ 中,则 $v=a_1u_1+\dots+a_mu_m=b_1w_1+\dots+b_nw_n$,于是 $a_1u_1+\dots+a_mu_m-b_1w_1-\dots-b_nw_n=0$。整组基线性无关,所以所有 $a$、$b$ 都是 0,$v=0$。

页边注:用同样的想法加上更高级的工具(如 Zorn 引理),不假设 $V$ 有限维也能证明这个结果。

2.33 的图景:ℝ³ 中的平面 $U$(蓝)与任何一条不在 $U$ 内、过原点的直线 $W$ 都满足 $\mathbb{R}^3=U\oplus W$。图中三条直线 $W,W',W''$ 都是 $U$ 的直和补。(可拖动旋转)
常见误区:补空间是唯一的、而且是「垂直」的 2.33 只保证 $W$ 存在。扩充基的时候,新添的向量有无穷多种选法,所以 $W$ 远不唯一,也完全不必和 $U$ 垂直——此时我们甚至还没有「垂直」这个概念。到第 6 章有了内积,才会有一个特别的补空间:正交补 $U^\perp$。

$(1,2),\,(3,5),\,(4,13)$ 是不是 𝐅² 的一组基?

$U$ 是 ℝ³ 中一个过原点的平面。满足 $\mathbb{R}^3=U\oplus W$ 的子空间 $W$ 有多少个?

基basis既线性无关又张成 $V$ 的组;等价地,每个 $v\in V$ 都能唯一写成它的线性组合(2.28)。
标准基standard basis𝐅ⁿ 中的 $(1,0,\dots,0),\dots,(0,\dots,0,1)$;$\mathcal{P}_m(\mathbf{F})$ 中的 $1,z,\dots,z^m$。
基的判定准则criterion for basis$v_1,\dots,v_n$ 是基 ⟺ 每个向量都能唯一地写成 $a_1v_1+\dots+a_nv_n$;这组系数就是坐标。
本节要点
  • 基 = 线性无关 + 张成 = 每个向量都有唯一坐标。
  • 张成组 → 删成基(2.30,筛子);线性无关组 → 扩成基(2.32,接上张成组再过筛)。有限维空间都有基(2.31)。
  • 每个子空间 $U$ 都有直和补 $W$:$V=U\oplus W$(2.33),但 $W$ 不唯一。

2C 维数 Dimension

我们一直在谈「有限维」,却还没定义「维数」。合理的定义应当让 𝐅ⁿ 的维数等于 $n$——而 𝐅ⁿ 的标准基长度正好是 $n$。于是自然想把维数定义为「基的长度」。可是一个空间有无穷多组基,这个定义要站得住,必须先证明:同一个空间的所有基一样长。幸运的是,这正是 2.22 的直接推论。

定理基的长度与基的选取无关basis length does not depend on basis2.34

有限维向量空间的任意两组基长度相同。

证明:2.22 正着用一次,反着用一次

设 $B_1,B_2$ 是 $V$ 的两组基。$B_1$ 线性无关、$B_2$ 张成 $V$,由 2.22,$B_1$ 的长度 ≤ $B_2$ 的长度。交换两者的角色,又得 $B_2$ 的长度 ≤ $B_1$ 的长度。所以两者相等。

直觉 每组基都同时是「线性无关组」和「张成组」。2.22 说任何无关组都不比任何张成组长,于是两组基只能互相「顶住」——一样长。一个简单的不等式,就把「维数」这个概念立住了。
定义维数dimension, dim V2.35

有限维向量空间的维数,是它任意一组基的长度,记作 $\dim V$。

例维数的例子dimensions2.36

• $\dim\mathbf{F}^n=n$:标准基长度为 $n$。

• $\dim\mathcal{P}_m(\mathbf{F})=m+1$:标准基 $1,z,\dots,z^m$ 长度为 $m+1$(别忘了常数项 1)。

• $U=\{(x,x,y)\in\mathbf{F}^3: x,y\in\mathbf{F}\}$ 时 $\dim U=2$:$(1,1,0),(0,0,1)$ 是 $U$ 的基。

• $U=\{(x,y,z)\in\mathbf{F}^3: x+y+z=0\}$ 时 $\dim U=2$:$(1,-1,0),(1,0,-1)$ 是 $U$ 的基。几何上,ℝ³ 中过原点的平面都是 2 维子空间,过原点的直线都是 1 维子空间。

有限维空间的子空间也是有限维的(2.25),所以有维数。下面是意料之中的不等式。

定理子空间的维数dimension of a subspace2.37

若 $V$ 有限维,$U$ 是 $V$ 的子空间,则 $\dim U\le\dim V$。

证明

把 $U$ 的一组基看成 $V$ 中的线性无关组,把 $V$ 的一组基看成 $V$ 的张成组,由 2.22 即得 $\dim U\le\dim V$。

维数和 𝐅 有关 实向量空间 ℝ² 是 2 维的;复向量空间 ℂ 是 1 维的($1$ 自己就能张成 ℂ:每个复数都是 $1$ 的复数倍)。作为集合,ℝ² 可以和 ℂ 等同,加法一样,乘以实数也一样——但维数不同。所以谈论维数时,不能忽略 𝐅 的选择。

2.22 和维数合在一起,给出一幅很好记的「长度图」:

线性无关组的长度都在这里(≤ n) 张成组的长度都在这里(≥ n) 0 1 2 ⋯ n+1 n+2 ⋯ n = dim V 基:长度恰好为 n,两块区域唯一的交点 组的长度
组的长度 < dim V ⇒ 张不满;长度 > dim V ⇒ 一定线性相关;长度 = dim V ⇒ 无关与张成两个条件只需查一个(2.38、2.42)。

长度对了,只需检查一半

按定义,验证一个组是基要查两件事:线性无关、张成 $V$。下面两个结果说:如果这个组的长度恰好是 $\dim V$,只要查其中一件就够了。先看线性无关的情形。

定理长度合适的线性无关组是基linearly independent list of the right length is a basis2.38

设 $V$ 有限维。那么 $V$ 中每个长度为 $\dim V$ 的线性无关组都是 $V$ 的基。

证明

设 $\dim V=n$,$v_1,\dots,v_n$ 线性无关。由 2.32,它可以扩充成 $V$ 的基;但每组基的长度都是 $n$,所以这次扩充是平凡的——一个向量也没添。因此 $v_1,\dots,v_n$ 本身就是基。

推论维数满的子空间就是整个空间subspace of full dimension equals the whole space2.39

设 $V$ 有限维,$U$ 是 $V$ 的子空间且 $\dim U=\dim V$,则 $U=V$。

证明

取 $U$ 的一组基 $u_1,\dots,u_n$,$n=\dim U=\dim V$。它是 $V$ 中长度为 $\dim V$ 的线性无关组,由 2.38 是 $V$ 的基,所以 $V$ 中每个向量都是 $u$ 们的线性组合,从而属于 $U$。于是 $U=V$。

几何上:ℝ³ 里一个 3 维子空间不可能只是「一部分」——它就是 ℝ³ 本身;ℝ² 里一个 2 维子空间就是整个平面。

例𝐅² 的一组基a basis of F²2.40

$(5,7),(4,3)$ 在 𝐅² 中线性无关(两者都不是对方的倍数),长度为 $2=\dim\mathbf{F}^2$,由 2.38 它是 𝐅² 的基——完全不用去验证它张成 𝐅²。

例𝒫₃(ℝ) 的一个子空间的基a basis of a subspace of 𝒫₃(R)2.41

设 $U=\{p\in\mathcal{P}_3(\mathbf{R}): p'(5)=0\}$,也就是「在 $x=5$ 处切线水平」的次数不超过 3 的多项式。求 $U$ 的一组基。

找无关组:$1,\ (x-5)^2,\ (x-5)^3$ 都在 $U$ 中(它们在 5 处的导数都是 0)。若 $a+b(x-5)^2+c(x-5)^3=0$ 对所有 $x$ 成立:左边有 $cx^3$ 项而右边没有,所以 $c=0$;于是左边有 $bx^2$ 项,所以 $b=0$;最后 $a=0$。因此这三个多项式线性无关,$3\le\dim U$。

夹逼维数:由 2.37,$3\le\dim U\le\dim\mathcal{P}_3(\mathbf{R})=4$。而 $x\notin U$(它的导数恒为 1),所以 $U\ne\mathcal{P}_3(\mathbf{R})$,由 2.39 得 $\dim U\ne4$。于是 $\dim U=3$,由 2.38,$1,(x-5)^2,(x-5)^3$ 是 $U$ 的基。

多项式也是向量:𝒫₃ 的基、坐标与子空间 U

「标准基」模式:四个滑块就是 $p$ 在基 $1,x,x^2,x^3$ 下的坐标,彩色虚线是各个分量,粗实线是它们的和 $p$。「例 2.41」模式:用 $1,(x-5)^2,(x-5)^3$ 组合出 $U$ 中的多项式——盯住 $x=5$ 处的紫色切线;第四个滑块 $d$ 加入 $(x-5)$ 方向,把 $p$ 推出 $U$。

多项式空间里,「向量」是一整条曲线,「基」是几条基本曲线,「坐标」是配比。标准基下 4 个旋钮互不干扰,恰好对应 $\dim\mathcal{P}_3=4$。在「例 2.41」模式里,只要 $d=0$,无论 $a,b,c$ 怎么调,$x=5$ 处的切线都是水平的——这 3 个旋钮刚好填满 3 维的 $U$;一动 $d$,切线就倾斜,$p$ 离开 $U$。$1,(x-5),(x-5)^2,(x-5)^3$ 是 $\mathcal{P}_3(\mathbf{R})$ 的一组基,因此 $\mathcal{P}_3(\mathbf{R})=U\oplus\operatorname{span}(x-5)$——这就是 2.32、2.33 在多项式空间里的样子。同一个 $p$ 在两组基下坐标完全不同,读数里可以对照。

再看张成的情形。

定理长度合适的张成组是基spanning list of the right length is a basis2.42

设 $V$ 有限维。那么每个张成 $V$、长度为 $\dim V$ 的组都是 $V$ 的基。

证明

设 $\dim V=n$,$v_1,\dots,v_n$ 张成 $V$。由 2.30,它可以删减成 $V$ 的基;但每组基的长度都是 $n$,所以这次删减是平凡的——一个向量也没删。因此 $v_1,\dots,v_n$ 本身就是基。

组的长度能否线性无关能否张成 V结论
< dim V可能不可能(2.22)一定不是基
= dim V可能可能线性无关 ⟺ 张成 ⟺ 是基(2.38、2.42)
> dim V不可能(2.22)可能一定不是基

在一个 5 维空间 $V$ 中,某个长度为 5 的组张成 $V$。关于这个组,哪个说法正确?

和的维数

本章最后一个结果给出两个子空间之和的维数。它和一个熟悉的计数公式如出一辙:两个有限集之并的元素个数 = 第一个的个数 + 第二个的个数 − 交集的个数。

定理和的维数dimension of a sum2.43

若 $V_1,V_2$ 是有限维向量空间的子空间,则

$$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2).$$
直觉:交集被数了两次 把 $V_1$ 的基和 $V_2$ 的基直接拼起来,数出来的是 $\dim V_1+\dim V_2$;但两者公共的部分 $V_1\cap V_2$ 的方向被数了两次,要减掉一次。在 ℝ³ 中:两个不同的平面(2 + 2)交于一条直线(−1),合起来张成整个 ℝ³(= 3)。
ℝ³ 中的两个子空间:dim(V₁+V₂) = dim V₁ + dim V₂ − dim(V₁∩V₂)

选择 $V_1$(蓝)、$V_2$(红)是平面还是直线;用滑块转动 $V_2$:α 是它相对 $V_1$ 的倾角,β 是转轴的方向。紫色是交 $V_1\cap V_2$(一条线,或者只剩原点),绿色是和 $V_1+V_2$。读数中的 $\dim(V_1+V_2)$ 是把两边的张成向量合在一起直接数出来的,不是用公式算的。拖动空白处可旋转视角。

一般位置下:两平面 $2+2-1=3$,直线与平面 $1+2-0=3$(直和 $V_1\oplus V_2=\mathbb{R}^3$),两直线 $1+1-0=2$(和是一个平面)。把 α 拖到 0 让它们「对齐」:交突然变大、和突然变小,但公式两边始终相等。再试试「V₁ = 直线、V₂ = 平面、β = 0」:此时转轴正是 $V_1$ 那条直线,无论 α 取多少,直线都躺在平面里。维数只在「特殊位置」才跳变——而 2.43 在每种位置都成立。

下面用步骤图走一遍 2.43 的证明(以两个平面为例),完整证明附在后面。

第 1 步:两个子空间与它们的交

$V_1$(蓝)、$V_2$(红)是 ℝ³ 中过原点的两个不同平面,$\dim V_1=\dim V_2=2$,它们的交 $V_1\cap V_2$ 是一条直线(紫)。

第 2 步:取交的基 v₁(m = 1)

先为 $V_1\cap V_2$ 选一组基 $v_1,\dots,v_m$。这里交是直线,所以 $m=1$。

第 3 步:扩充成 V₁ 的基 v₁, u₁(j = 1)

$v_1$ 在 $V_1$ 中线性无关,由 2.32 可以扩充成 $V_1$ 的基 $v_1,u_1$。于是 $\dim V_1=m+j=2$。

第 4 步:扩充成 V₂ 的基 v₁, w₁(k = 1)

同样把 $v_1$ 扩充成 $V_2$ 的基 $v_1,w_1$,$\dim V_2=m+k=2$。

第 5 步:合起来是 V₁ + V₂ 的基

$v_1,u_1,w_1$ 显然张成 $V_1+V_2$(它的张成同时包含 $V_1$ 和 $V_2$);证明的关键是它线性无关(见下方完整证明)。这里 $V_1+V_2=\mathbb{R}^3$(绿色立方体示意)。

第 6 步:数一数

$\dim(V_1+V_2)=m+j+k=3=(m+j)+(m+k)-m=2+2-1$。交的基 $v_1$ 在 $V_1$、$V_2$ 的基里各出现一次,被数了两次,所以减去一次 $\dim(V_1\cap V_2)$。

2.43 的完整证明

设 $v_1,\dots,v_m$ 是 $V_1\cap V_2$ 的基,所以 $\dim(V_1\cap V_2)=m$。它在 $V_1$ 中线性无关,由 2.32 可扩充成 $V_1$ 的基 $v_1,\dots,v_m,u_1,\dots,u_j$,所以 $\dim V_1=m+j$。同样扩充成 $V_2$ 的基 $v_1,\dots,v_m,w_1,\dots,w_k$,$\dim V_2=m+k$。下面证明

$$v_1,\dots,v_m,\ u_1,\dots,u_j,\ w_1,\dots,w_k$$(2.44)

是 $V_1+V_2$ 的基。这样就有 $\dim(V_1+V_2)=m+j+k=(m+j)+(m+k)-m=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$。

张成:组 (2.44) 包含于 $V_1\cup V_2$,从而包含于 $V_1+V_2$;它的张成包含 $V_1$ 也包含 $V_2$,所以等于 $V_1+V_2$。

线性无关:设 $a_1v_1+\dots+a_mv_m+b_1u_1+\dots+b_ju_j+c_1w_1+\dots+c_kw_k=0$。改写成

$$c_1w_1+\dots+c_kw_k=-a_1v_1-\dots-a_mv_m-b_1u_1-\dots-b_ju_j,$$(2.45)

右边在 $V_1$ 中,所以 $c_1w_1+\dots+c_kw_k\in V_1$;而 $w$ 们都在 $V_2$ 中,所以它属于 $V_1\cap V_2$,可以写成 $d_1v_1+\dots+d_mv_m$。但 $v_1,\dots,v_m,w_1,\dots,w_k$ 线性无关,所以所有 $c$(以及 $d$)都是 0。于是 (2.45) 变成 $a_1v_1+\dots+a_mv_m+b_1u_1+\dots+b_ju_j=0$,而 $v_1,\dots,v_m,u_1,\dots,u_j$ 线性无关,所有 $a$、$b$ 也都是 0。∎

设 $\#S$ 表示有限集 $S$ 的元素个数。原书用一张表对照「有限集」与「有限维向量空间」:$\#S$ 对应 $\dim V$,子集的并对应子空间的和。

集合 sets向量空间 vector spaces
$S$ 是有限集$V$ 是有限维向量空间
$\#S$$\dim V$
对子集 $S_1,S_2$,并 $S_1\cup S_2$ 是包含 $S_1$、$S_2$ 的最小子集对子空间 $V_1,V_2$,和 $V_1+V_2$ 是包含 $V_1$、$V_2$ 的最小子空间
$\#(S_1\cup S_2)=\#S_1+\#S_2-\#(S_1\cap S_2)$$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$
$\#(S_1\cup S_2)=\#S_1+\#S_2\iff S_1\cap S_2=\varnothing$$\dim(V_1+V_2)=\dim V_1+\dim V_2\iff V_1\cap V_2=\{0\}$
$S_1\cup\dots\cup S_m$ 是不交并 ⟺ $\#(S_1\cup\dots\cup S_m)=\#S_1+\dots+\#S_m$$V_1+\dots+V_m$ 是直和 ⟺ $\dim(V_1+\dots+V_m)=\dim V_1+\dots+\dim V_m$

最后一行说的是「不交并」与「直和」的类比,其证明在原书 3.94。习题 2C.12–2C.18 都能在集合论里找到对应的结论。

类比的边界:三个子空间时容斥公式不成立 集合有三集合的容斥公式,但子空间没有:ℝ² 中三条不同的过原点直线,和是 ℝ²(维数 2),而「容斥」算出来是 $1+1+1-0-0-0+0=3$。原因是子空间的交与和不满足分配律:$(V_1+V_2)\cap V_3$ 未必等于 $(V_1\cap V_3)+(V_2\cap V_3)$(习题 2C.19)。

ℝ³ 中两个不同的平面(都过原点),它们的交是几维的?

维数dimension有限维空间任意一组基的长度 $\dim V$(所有基一样长,2.34);$\dim\mathbf{F}^n=n$,$\dim\mathcal{P}_m(\mathbf{F})=m+1$。
和的维数dimension of a sum$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$,类似集合的容斥原理(2.43)。
本节要点
  • 所有基一样长(2.34),所以维数 = 基的长度是良定义的;子空间的维数不超过全空间(2.37),维数满了就是全空间(2.39)。
  • 长度等于 $\dim V$ 时,线性无关 ⟺ 张成 ⟺ 是基(2.38、2.42)——判断基时省一半力气。
  • $\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$(2.43);交为 $\{0\}$ 时维数直接相加。

本章小结

  • 张成:$\operatorname{span}(v_1,\dots,v_m)$ = 全部线性组合 = 包含这些向量的最小子空间(2.6)。有限个向量能张成整个空间,空间就是有限维的(2.9);$\mathcal{P}(\mathbf{F})$ 是无限维的(2.14)。
  • 线性无关:只有全零系数能组合出 0 ⟺ 表示法唯一(2.15)。线性相关引理(2.19):相关组里总有 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$,删掉它张成不变。
  • 核心不等式(2.22):无关组长度 ≤ 张成组长度,证明是「放进一个 $u$、踢出一个 $w$」的替换。推论:有限维空间的子空间有限维(2.25)。
  • 基 = 线性无关 + 张成 ⟺ 每个向量有唯一坐标(2.28)。张成组可删成基(2.30),无关组可扩成基(2.32),每个子空间都有直和补(2.33)。
  • 维数:所有基一样长(2.34),$\dim V$ = 基的长度(2.35);$\dim U\le\dim V$(2.37);长度为 $\dim V$ 的组,无关 ⟺ 张成 ⟺ 基(2.38、2.42)。
  • 维数公式(2.43):$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$,与集合的容斥计数完全类比。
张成组 spanning list线性无关组 linearly independent list基 basis
含义够用:每个向量都写得出来不浪费:写法唯一刚刚好:唯一坐标
长度≥ dim V≤ dim V= dim V
怎样变成基删掉多余的(2.30)添上缺少的(2.32)已经是
ℝ³ 中的样子至少 3 个,不全在一个平面里至多 3 个,每个都带来新方向恰好 3 个不共面的向量

概念之间的联系:线性组合 → 张成 → 有限维;线性无关 → 线性相关引理 → 核心不等式 2.22 → 所有基一样长 → 维数 → 「只查一半」与维数公式。引理还驱动了「筛子」(2.30),筛子又给出了扩充(2.32)与直和补(2.33)。

前后章节:本章用到第 1 章的子空间、子空间的和与直和(1.34、1.46)。第 3 章会看到:线性映射由它在一组基上的取值完全决定(3.4);维数公式的「映射版」是线性映射基本定理 $\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$(3.21);选定基后,线性映射就变成矩阵。

自测

前面各节已经穿插了 9 道题,这里再来几道综合题。

$\dim\mathcal{P}_3(\mathbf{R})$ 等于多少?

空间 $\{0\}$ 的基是什么?

$V$ 是 7 维空间,$U$、$W$ 是它的两个 4 维子空间。$U\cap W$ 至少是几维?

把 ℂ 看成 ℂ 上的向量空间,以及看成 ℝ 上的向量空间,维数分别是多少?

为什么 $\mathcal{P}(\mathbf{F})$ 是无限维的?

习题

选自原书各节末的习题,编号与原书一致(如 2A.5 表示 Exercises 2A 第 5 题)。先自己想,再看提示和解答。

2A.5求一个数 $t$,使得 $(3,1,4),\,(2,-3,5),\,(5,9,t)$ 在 ℝ³ 中不线性无关。
提示前两个向量不共线(线性无关)。用线性相关引理:整组相关当且仅当第三个向量落在前两个的张成里。
参考解答

$(3,1,4)$ 与 $(2,-3,5)$ 不成比例,所以线性无关。由线性相关引理(或习题 2A.13),整组线性相关 ⟺ $(5,9,t)\in\operatorname{span}\big((3,1,4),(2,-3,5)\big)$。

设 $a(3,1,4)+b(2,-3,5)=(5,9,t)$。前两个分量:$3a+2b=5$,$a-3b=9$,解得 $a=3,\ b=-2$。第三个分量要求 $t=4a+5b=12-10=2$。

所以 $t=2$:此时 $3(3,1,4)-2(2,-3,5)-(5,9,2)=0$,组线性相关(而 $t\ne2$ 时组线性无关)。

2A.7(a) 证明:把 ℂ 看成 ℝ 上的向量空间,组 $1+i,\ 1-i$ 线性无关。(b) 证明:把 ℂ 看成 ℂ 上的向量空间,组 $1+i,\ 1-i$ 线性相关。
提示(a) 系数只能取实数,比较实部与虚部。(b) 找一个复数 $\lambda$ 使 $1-i=\lambda(1+i)$。
参考解答

(a) 设 $a,b\in\mathbf{R}$ 且 $a(1+i)+b(1-i)=0$,即 $(a+b)+(a-b)i=0$。实部、虚部都为 0:$a+b=0$,$a-b=0$,所以 $a=b=0$,线性无关。

(b) $-i(1+i)=-i-i^2=1-i$,所以 $i\cdot(1+i)+1\cdot(1-i)=i-1+1-i=0$,系数 $i,1$ 不全为 0,线性相关。

结论:线性无关与否取决于允许用哪些数做系数,也就是取决于 𝐅。

2A.8设 $v_1,v_2,v_3,v_4$ 在 $V$ 中线性无关。证明 $v_1-v_2,\ v_2-v_3,\ v_3-v_4,\ v_4$ 也线性无关。
提示设一个线性组合为 0,按 $v_1,\dots,v_4$ 重新整理系数。
参考解答

设 $a_1(v_1-v_2)+a_2(v_2-v_3)+a_3(v_3-v_4)+a_4v_4=0$。整理得

$a_1v_1+(a_2-a_1)v_2+(a_3-a_2)v_3+(a_4-a_3)v_4=0$。

由 $v_1,\dots,v_4$ 线性无关,所有系数为 0:$a_1=0$,$a_2=a_1=0$,$a_3=a_2=0$,$a_4=a_3=0$。所以新组线性无关。

2A.13设 $v_1,\dots,v_m$ 在 $V$ 中线性无关,$w\in V$。证明:$v_1,\dots,v_m,w$ 线性无关 ⟺ $w\notin\operatorname{span}(v_1,\dots,v_m)$。
提示「⇒」用逆否:若 $w$ 在张成里,就能写出一个 $w$ 的系数为 $-1$ 的零组合。「⇐」看 $w$ 的系数是否为 0。
参考解答

(⇒) 若 $w\in\operatorname{span}(v_1,\dots,v_m)$,写 $w=a_1v_1+\dots+a_mv_m$,则 $a_1v_1+\dots+a_mv_m+(-1)w=0$,且 $w$ 的系数 $-1\ne0$,所以 $v_1,\dots,v_m,w$ 线性相关。取逆否即得。

(⇐) 设 $w\notin\operatorname{span}(v_1,\dots,v_m)$,且 $a_1v_1+\dots+a_mv_m+bw=0$。若 $b\ne0$,则 $w=-\frac{a_1}{b}v_1-\dots-\frac{a_m}{b}v_m$ 在张成里,矛盾;所以 $b=0$。于是 $a_1v_1+\dots+a_mv_m=0$,由 $v$ 们线性无关得所有 $a_k=0$。因此 $v_1,\dots,v_m,w$ 线性无关。

这正是「筛子」每一步的判断依据:新向量只要不在已有向量的张成里,加进来仍保持线性无关。

2A.15–16(15) 解释为什么 $\mathcal{P}_4(\mathbf{F})$ 中不存在长度为 6 的线性无关组。(16) 解释为什么长度为 4 的组都张成不了 $\mathcal{P}_4(\mathbf{F})$。
提示找一个长度为 5 的张成组和一个长度为 5 的线性无关组,然后用 2.22。
参考解答

(15) $1,z,z^2,z^3,z^4$ 张成 $\mathcal{P}_4(\mathbf{F})$,长度为 5。由 2.22,$\mathcal{P}_4(\mathbf{F})$ 中每个线性无关组的长度都 ≤ 5,所以没有长度为 6 的线性无关组。

(16) $1,z,z^2,z^3,z^4$ 在 $\mathcal{P}_4(\mathbf{F})$ 中线性无关(例 2.16(b)),长度为 5。由 2.22,每个张成组的长度都 ≥ 5,所以长度为 4 的组张成不了 $\mathcal{P}_4(\mathbf{F})$。

2B.1找出所有恰好只有一组基的向量空间。
提示如果 $v_1,\dots,v_n$ 是基且 $n\ge1$,把 $v_1$ 换成 $2v_1$ 会怎样?别忘了本书中「基」是有限长的组。
参考解答

答案:只有 $\{0\}$。

$\{0\}$ 的基:空组线性无关且 $\operatorname{span}(\ )=\{0\}$,所以空组是基;任何非空组都只能由 0 组成,线性相关,不是基。因此 $\{0\}$ 恰好有一组基。

若 $V\ne\{0\}$ 且有限维,它有一组基 $v_1,\dots,v_n$(2.31),且 $n\ge1$(否则 $V=\operatorname{span}(\ )=\{0\}$)。那么 $2v_1,v_2,\dots,v_n$ 也线性无关且张成 $V$,也是基;由于 $v_1\ne0$,$2v_1\ne v_1$,这是另一组基。若 $V$ 无限维,则它没有(有限长的)基。所以只有 $\{0\}$ 恰有一组基。

2B.3设 $U=\{(x_1,x_2,x_3,x_4,x_5)\in\mathbf{R}^5: x_1=3x_2 \text{ 且 } x_3=7x_4\}$。(a) 求 $U$ 的一组基;(b) 把它扩充成 ℝ⁵ 的基;(c) 求 ℝ⁵ 的子空间 $W$ 使 $\mathbf{R}^5=U\oplus W$。
提示$U$ 中的向量由 $x_2,x_4,x_5$ 三个自由参数决定。扩充时试试添上 $e_1,e_3$。
参考解答

(a) $U$ 中的向量形如 $(3x_2,x_2,7x_4,x_4,x_5)=x_2(3,1,0,0,0)+x_4(0,0,7,1,0)+x_5(0,0,0,0,1)$,所以这三个向量张成 $U$;看第 2、4、5 个分量可知它们线性无关。基:$(3,1,0,0,0),\ (0,0,7,1,0),\ (0,0,0,0,1)$,$\dim U=3$。

(b) 添上 $e_1=(1,0,0,0,0)$ 与 $e_3=(0,0,1,0,0)$。这 5 个向量张成 ℝ⁵:$e_2=(3,1,0,0,0)-3e_1$,$e_4=(0,0,7,1,0)-7e_3$,$e_5$ 已在其中。长度 $5=\dim\mathbf{R}^5$,由 2.42 是 ℝ⁵ 的基。

(c) 取 $W=\operatorname{span}(e_1,e_3)=\{(x,0,y,0,0): x,y\in\mathbf{R}\}$。按 2.33 的证明,$\mathbf{R}^5=U\oplus W$。

2B.8证明或举反例:若 $v_1,v_2,v_3,v_4$ 是 $V$ 的基,$U$ 是 $V$ 的子空间,且 $v_1,v_2\in U$、$v_3\notin U$、$v_4\notin U$,则 $v_1,v_2$ 是 $U$ 的基。
提示$U$ 可能还含有 $v_3+v_4$ 这样的向量。
参考解答

结论不成立。取 $V=\mathbf{R}^4$,$v_1,\dots,v_4$ 为标准基 $e_1,\dots,e_4$,令 $U=\operatorname{span}(e_1,e_2,e_3+e_4)=\{(x,y,z,z)\}$。则 $e_1,e_2\in U$;$e_3=(0,0,1,0)$ 与 $e_4=(0,0,0,1)$ 的后两个分量不相等,都不在 $U$ 中。但 $e_3+e_4\in U$ 而不在 $\operatorname{span}(e_1,e_2)$ 中,所以 $e_1,e_2$ 张成不了 $U$,不是 $U$ 的基(实际上 $\dim U=3$)。

2C.1证明 ℝ² 的子空间恰好是:$\{0\}$、ℝ² 中所有过原点的直线、以及 ℝ² 本身。
提示按子空间的维数 0、1、2 分类,分别用维数的定义和 2.39。
参考解答

设 $U$ 是 ℝ² 的子空间。由 2.37,$\dim U\in\{0,1,2\}$。

• $\dim U=0$:基是空组,$U=\operatorname{span}(\ )=\{0\}$。
• $\dim U=1$:基是一个非零向量 $u$,$U=\operatorname{span}(u)=\{tu:t\in\mathbf{R}\}$,是过原点、沿 $u$ 方向的直线。
• $\dim U=2$:由 2.39,$U=\mathbf{R}^2$。

反过来,$\{0\}$、过原点的直线 $\operatorname{span}(u)$、ℝ² 都是子空间(张成都是子空间,2.6)。

2C.3设 $U=\{p\in\mathcal{P}_4(\mathbf{F}): p(6)=0\}$。(a) 求 $U$ 的一组基;(b) 把它扩充成 $\mathcal{P}_4(\mathbf{F})$ 的基;(c) 求 $\mathcal{P}_4(\mathbf{F})$ 的子空间 $W$ 使 $\mathcal{P}_4(\mathbf{F})=U\oplus W$。
提示模仿例 2.41,用以 6 为中心的幂 $(z-6)^k$。
参考解答

(a) $(z-6),\ (z-6)^2,\ (z-6)^3,\ (z-6)^4$ 都在 $U$ 中。它们线性无关:若 $c_1(z-6)+\dots+c_4(z-6)^4=0$,比较 $z^4$ 项得 $c_4=0$,再比较 $z^3$ 项得 $c_3=0$,依此类推全为 0。所以 $\dim U\ge4$。又 $1\notin U$,所以 $U\ne\mathcal{P}_4(\mathbf{F})$,由 2.39 得 $\dim U\ne5$,而 $\dim U\le5$,故 $\dim U=4$。由 2.38,这四个多项式是 $U$ 的基。

(b) 添上常数 $1$:$1,(z-6),(z-6)^2,(z-6)^3,(z-6)^4$ 线性无关(同样比较最高次项),长度 $5=\dim\mathcal{P}_4(\mathbf{F})$,由 2.38 是基。

(c) $W=\operatorname{span}(1)$,即全体常数多项式。按 2.33 的证明,$\mathcal{P}_4(\mathbf{F})=U\oplus W$。直观地:每个 $p$ 都唯一地写成 $p(6)+\big(p-p(6)\big)$,后者在 $U$ 中。

2C.14设 $V$ 是 10 维向量空间,$V_1,V_2,V_3$ 是 $V$ 的子空间,$\dim V_1=\dim V_2=\dim V_3=7$。证明 $V_1\cap V_2\cap V_3\ne\{0\}$。
提示用两次维数公式,每次都用「和的维数 ≤ 10」。
参考解答

$V_1+V_2$ 是 $V$ 的子空间,维数 ≤ 10,所以 $\dim(V_1\cap V_2)=7+7-\dim(V_1+V_2)\ge4$。

再对 $V_1\cap V_2$ 与 $V_3$ 用维数公式:$\dim(V_1\cap V_2\cap V_3)=\dim(V_1\cap V_2)+\dim V_3-\dim\big((V_1\cap V_2)+V_3\big)\ge4+7-10=1$。所以 $V_1\cap V_2\cap V_3\ne\{0\}$。

2C.19与三个有限集之并的元素个数公式类比,你可能猜测:对有限维空间的子空间 $V_1,V_2,V_3$, $$\dim(V_1+V_2+V_3)=\dim V_1+\dim V_2+\dim V_3-\dim(V_1\cap V_2)-\dim(V_1\cap V_3)-\dim(V_2\cap V_3)+\dim(V_1\cap V_2\cap V_3).$$ 证明这个公式,或者举出反例。
提示在 ℝ² 里找三个子空间,它们两两相交只有 0,但和的维数「装不下」。
参考解答

公式不成立。取 ℝ² 中三条不同的过原点直线,例如 $V_1=\operatorname{span}\big((1,0)\big)$、$V_2=\operatorname{span}\big((0,1)\big)$、$V_3=\operatorname{span}\big((1,1)\big)$。两两的交都是 $\{0\}$,三者的交也是 $\{0\}$,所以右边 $=1+1+1-0-0-0+0=3$;而左边 $\dim(V_1+V_2+V_3)=\dim\mathbf{R}^2=2$。

为什么两个子空间时成立、三个时失败?集合满足分配律 $(S_1\cup S_2)\cap S_3=(S_1\cap S_3)\cup(S_2\cap S_3)$,三集合容斥依赖它;子空间却不满足对应的等式:上例中 $(V_1+V_2)\cap V_3=V_3$,而 $(V_1\cap V_3)+(V_2\cap V_3)=\{0\}$。

第 3 章

线性映射 Linear Maps

向量空间只是舞台,线性映射才是主角。本章研究「保持加法与数乘」的函数:它把什么压成 0(零空间),能到达哪里(值域),怎样用矩阵记录,何时可逆;最后由此引出积空间、商空间与对偶空间。

学习目标
  • 把线性映射看成「原点不动、网格线保持平行且等距」的变形;理解线性映射由它在一组基上的取值完全决定(线性映射引理 3.4)。
  • 会求零空间与值域,理解「单射 ⇔ 零空间只有 0」,熟练运用线性映射基本定理 $\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$ 及其关于线性方程组的推论。
  • 理解线性映射的矩阵(第 $k$ 列 = $Tv_k$ 的坐标);明白矩阵乘法为什么这样定义(为了 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$);掌握列–行分解与「列秩 = 行秩」。
  • 理解可逆 = 单射 + 满射,有限维且维数相同时三者等价;同构 ⇔ 维数相同;会用基变换公式 $A=C^{-1}BC$。
  • 看懂积空间与商空间:$V/U$ 的元素是一族平行的「平移」$v+U$,并且 $\dim V/U=\dim V-\dim U$。
  • 理解线性泛函、对偶空间、对偶基、对偶映射与零化子,知道对偶映射的矩阵是原矩阵的转置。
一分钟速览
  • 线性映射是保持加法与数乘的函数;在平面上它就是「原点不动、直线仍是直线、平行仍平行、等距仍等距」的网格变形。它一定把 0 送到 0。
  • 基上的值决定一切:只要说出每个基向量去哪儿(可以随便指定),线性映射就唯一确定了。
  • 零空间与值域都是子空间;T 是单射 ⇔ 零空间只有 0。基本定理:原空间的维数 = 被压扁掉的维数 + 保留下来的维数。所以映到更低维的空间不可能单射,映到更高维的空间不可能满射。
  • 矩阵 $\mathcal{M}(T)$ 的第 $k$ 列记录 $Tv_k$ 的坐标;矩阵乘法就是映射复合,所以一般 $AB\ne BA$。任何矩阵都能分解为 $A=CR$,由此得到列秩 = 行秩。
  • 可逆 ⇔ 单射且满射;有限维同维时,单射、满射、可逆三者等价。维数相同的有限维空间都同构,$\dim\mathcal{L}(V,W)=(\dim V)(\dim W)$。
  • 基变换:同一个算子在两组基下的矩阵满足 $A=C^{-1}BC$——换基就像换一副眼镜看同一个变形。
  • 商空间 $V/U$ 把「只差一个 $U$ 中向量」的点看作同一个元素:它的元素是一族平行线/平行面,维数是 $\dim V-\dim U$。
  • 对偶:$V'$ 由「吃向量吐数」的线性泛函组成;对偶映射 $T'(\varphi)=\varphi\circ T$ 反向工作,它的矩阵是 $\mathcal{M}(T)$ 的转置,单射与满射在对偶下互换。
本章地图 3A 线性映射L(V,W) 也是向量空间 3B 零空间与值域单射 ⇔ null T = {0} 3E 积与商dim V/U = dim V − dim U 3C 矩阵 M(T)乘法 = 复合 3B 基本定理 ★dim V = null + range 3F 对偶M(T′) = M(T)ᵗ 3C 秩列秩 = 行秩 3D 可逆与同构同维时 单射 ⇔ 满射 3D 基变换A = C⁻¹BC 3.4 3.21 3.105 3.125 3.65 3.71 3.57 3.84

点击方框跳到对应小节;箭头上的数字是原书编号。★ 基本定理位于中心:3D 的「单射 ⇔ 满射」、3E 的商空间维数、3F 的零化子维数都靠它推出。

本章约定(standing assumptions)与原书页码

全章约定:$\mathbf{F}$ 表示 $\mathbf{R}$ 或 $\mathbf{C}$;$U$、$V$、$W$ 都是 $\mathbf{F}$ 上的向量空间。从 3C 的「矩阵的加法与数乘」开始,还额外假设 $U$、$V$、$W$ 都是有限维的,并各自取定了一组基。

对照原书:3A 在第 52–58 页,3B 第 59–68 页,3C 第 69–81 页,3D 第 82–95 页,3E 第 96–104 页,3F 第 105–118 页(每节末尾都是习题)。

为什么要学线性映射

Axler 在本章开头说:「没有人会为向量空间本身而兴奋。线性代数真正有趣的部分,是我们现在要转向的主题——线性映射。」前两章搭好了舞台(向量空间、基、维数),从这一章起,舞台上的「动作」登场了:微分、积分、旋转、投影、解方程组……本质上都是线性映射。

3A 线性映射构成的向量空间 Vector Space of Linear Maps

这一节回答两个问题:什么样的函数配叫「线性」?以及把所有线性映射放在一起,又得到什么?答案是:保持加法与数乘的函数;它们本身又组成一个向量空间 $\mathcal{L}(V,W)$,而且还能「相乘」(复合)。

线性映射的定义与例子 Definition and Examples of Linear Maps

定义线性映射linear map3.1

从 $V$ 到 $W$ 的线性映射是一个函数 $T:V\to W$,满足

  • 可加性(additivity):对所有 $u,v\in V$,$T(u+v)=Tu+Tv$;
  • 齐次性(homogeneity):对所有 $\lambda\in\mathbf{F}$ 和 $v\in V$,$T(\lambda v)=\lambda(Tv)$。

「线性变换」(linear transformation)与「线性映射」是同义词。对线性映射,常把 $T(v)$ 简写成 $Tv$。

直觉:先组合再映射 = 先映射再组合

两条性质合起来就是 $T(au+bv)=aTu+bTv$:线性组合可以「穿过」$T$。在平面 $\mathbf{R}^2$ 上,这意味着:

  • 原点不动(下面的 3.10);
  • 直线变成直线(或被压成一个点),平行线仍然平行,等间距的点仍然等间距。

所以有一个「看图判断法」:把正方形网格画出来,线性映射的像一定还是一张平行四边形网格(可能被压扁成一条线甚至一个点),而且原点还在原点。只要网格弯了,或者原点被挪走了,就不是线性映射。

线性检验器:网格还直吗?加法、数乘还保持吗?

从下拉框选一个函数 $f:\mathbf{R}^2\to\mathbf{R}^2$。左图是定义域:拖动蓝点 $u$、红点 $v$(绿点是 $u+v$,紫点是 $\lambda u$)。右图是函数值:青色曲线是整张网格的像;实心绿点 $f(u+v)$ 与空心绿圈 $f(u)+f(v)$ 重合,说明可加性在这对向量上成立;实心紫点 $f(\lambda u)$ 与空心紫圈 $\lambda f(u)$ 重合,说明齐次性成立。

两个线性的例子(剪切、旋转)无论怎么拖,实心点和空心圈都严丝合缝,网格的像是平行四边形网格。「平移」连原点都挪走了($f(0)\ne0$),直接出局;「弯曲」把网格线弯成抛物线;最微妙的是最后一个:把 λ 滑到任何值,紫点都重合(齐次性成立),但绿点分开了——只有齐次性不够,这正是原书习题 3A.8 要的反例。

记号ℒ(V, W) 与 ℒ(V)3.2

从 $V$ 到 $W$ 的全体线性映射记作 $\mathcal{L}(V,W)$;从 $V$ 到自身的线性映射记作 $\mathcal{L}(V)=\mathcal{L}(V,V)$。($V$ 到自身的线性映射又叫算子(operator),原书在 5.1 正式命名。)

例线性映射的例子linear maps3.3

下面每一个都值得你花十秒钟验证一下「加法、数乘可以穿过它」:

名称定义为什么线性
零映射 zero$0\in\mathcal{L}(V,W)$,$0v=0$左边的 0 是函数,右边的 0 是 $W$ 的零向量
恒等算子 identity operator$I\in\mathcal{L}(V)$,$Iv=v$什么都不做
微分 differentiation$D\in\mathcal{L}(\mathcal{P}(\mathbf{R}))$,$Dp=p'$$(f+g)'=f'+g'$,$(\lambda f)'=\lambda f'$
积分 integration$T\in\mathcal{L}(\mathcal{P}(\mathbf{R}),\mathbf{R})$,$Tp=\int_0^1p$和的积分 = 积分的和
乘以 $x^2$$T\in\mathcal{L}(\mathcal{P}(\mathbf{R}))$,$(Tp)(x)=x^2p(x)$乘法对加法分配
后移 backward shift$T\in\mathcal{L}(\mathbf{F}^\infty)$,$T(x_1,x_2,x_3,\dots)=(x_2,x_3,\dots)$逐项操作
$\mathbf{R}^3\to\mathbf{R}^2$$T(x,y,z)=(2x-y+3z,\ 7x+5y-6z)$每个分量都是 $x,y,z$ 的线性组合
$\mathbf{F}^n\to\mathbf{F}^m$$T(x_1,\dots,x_n)=\big(\sum_k A_{1,k}x_k,\ \dots,\ \sum_k A_{m,k}x_k\big)$同上;而且 $\mathbf{F}^n\to\mathbf{F}^m$ 的线性映射全都长这样(习题 3A.3)
复合 composition固定 $q\in\mathcal{P}(\mathbf{R})$,$(Tp)(x)=p(q(x))$$(p_1+p_2)\circ q=p_1\circ q+p_2\circ q$

注意最后一个:$p\mapsto p\circ q$ 是线性的,但 $p\mapsto q\circ p$ 一般不是(习题 3A.10)——把 $p$ 放在「里面」还是「外面」差别很大。

常见误区
  • 中学里的「一次函数」$f(x)=mx+b$ 只有在 $b=0$ 时才是线性映射——线性映射必须把 0 送到 0(3.10)。$b\ne0$ 的叫仿射函数(affine function):线性映射再加一个平移。
  • Axler 的页边注调侃:线性映射虽然无处不在,但没有某些人想象的那么普遍——$\cos(x+y)\ne\cos x+\cos y$,$\cos 2x\ne2\cos x$。
  • 可加性和齐次性缺一不可:只有齐次性不够(上面演示的最后一个函数,习题 3A.8);在 $\mathbf{C}$ 上只有可加性也不够,例如取共轭 $z\mapsto\bar z$ 满足可加性,但 $\overline{iz}\ne i\bar z$(习题 3A.9)。

下一个结果是本章的第一块基石:线性映射完全由它在一组基上的取值决定,而且这些取值可以随便指定。

定理线性映射引理linear map lemma3.4

设 $v_1,\dots,v_n$ 是 $V$ 的一组基,$w_1,\dots,w_n\in W$ 是任意向量。则存在唯一的线性映射 $T:V\to W$ 使得对每个 $k$ 都有 $Tv_k=w_k$。

证明思路

核心想法:每个 $v\in V$ 都能唯一地写成 $v=c_1v_1+\dots+c_nv_n$,而线性映射必须让线性组合穿过它,所以只能定义

$$T(c_1v_1+\dots+c_nv_n)=c_1w_1+\dots+c_nw_n.$$

存在性:由于坐标 $c_k$ 唯一,上式确实定义了一个函数;取 $c_k=1$、其余为 0 得 $Tv_k=w_k$。若 $u=\sum a_kv_k$、$v=\sum c_kv_k$,则 $T(u+v)=\sum(a_k+c_k)w_k=Tu+Tv$;同理 $T(\lambda v)=\lambda Tv$。

唯一性:若 $T$ 线性且 $Tv_k=w_k$,则齐次性给出 $T(c_kv_k)=c_kw_k$,可加性再给出 $T(\sum c_kv_k)=\sum c_kw_k$——$T$ 在 $\operatorname{span}(v_1,\dots,v_n)=V$ 上被完全确定。

直觉:说出基向量去哪儿,就说完了整个映射

「存在」说的是:基上的取值可以随心所欲——$w_k$ 可以相同、可以是 0、可以线性相关,都能找到对应的线性映射。「唯一」说的是:一旦基上的值定了,就别无选择。这正是下一节「矩阵」的根据:只要把 $w_1,\dots,w_n$ 的坐标记下来,就记下了整个 $T$。

线性映射引理:在基上随意指定取值,整张网格随之确定

左图是 $V=\mathbf{R}^2$:拖动基向量 $v_1$(蓝)、$v_2$(红)和任意向量 $v$(绿);紫色斜网格是以 $v_1,v_2$ 为「尺子」的坐标网格。右图是 $W=\mathbf{R}^2$:拖动 $w_1$、$w_2$,规定 $Tv_1=w_1$、$Tv_2=w_2$。$v$ 在左图的斜网格上读出坐标 $(c_1,c_2)$,右图就按同样的坐标拼出 $Tv=c_1w_1+c_2w_2$。

左边的斜网格被「原样搬运」到右边:网格上坐标为 $(c_1,c_2)$ 的格点,一定落到右边坐标为 $(c_1,c_2)$ 的格点。点「令 $w_2=w_1$」或「令 $w_2=0$」:引理照样成立,只是右边的网格被压扁成一条线——这时 $T$ 不再是单射(下一节的主题)。如果把 $v_1,v_2$ 拖成共线,它们就不再是基,引理的前提失效。

设 $T:\mathbf{R}^2\to\mathbf{R}^2$ 线性,$T(1,0)=(2,1)$,$T(0,1)=(-1,3)$。那么 $T(2,-1)$ 等于?

ℒ(V,W) 上的代数运算 Algebraic Operations on L(V, W)

线性映射本身也可以相加、数乘——就像函数那样「逐点」进行。

定义ℒ(V,W) 上的加法与数乘addition and scalar multiplication on ℒ(V, W)3.5

设 $S,T\in\mathcal{L}(V,W)$,$\lambda\in\mathbf{F}$。定义 $(S+T)(v)=Sv+Tv$,$(\lambda T)(v)=\lambda(Tv)$(对所有 $v\in V$)。容易验证 $S+T$ 与 $\lambda T$ 仍是线性映射。

定理ℒ(V,W) 是向量空间ℒ(V, W) is a vector space3.6

在上述加法与数乘下,$\mathcal{L}(V,W)$ 是一个向量空间,它的零元就是零映射。

一般来说,向量空间里的两个元素没法「相乘」。但对线性映射,有一种非常有用的乘法——复合。

定义线性映射的积product of linear maps3.7

若 $T\in\mathcal{L}(U,V)$、$S\in\mathcal{L}(V,W)$,定义积 $ST\in\mathcal{L}(U,W)$ 为 $(ST)(u)=S(Tu)$。

$ST$ 就是复合 $S\circ T$:从右往左读——先做 $T$,再做 $S$。只有当 $T$ 的值落在 $S$ 的定义域里时 $ST$ 才有意义。写成「乘积」是为了让下面的分配律看起来自然。

定理线性映射之积的代数性质algebraic properties of products of linear maps3.8
  • 结合律:$(T_1T_2)T_3=T_1(T_2T_3)$(只要乘积有意义);
  • 单位元:对 $T\in\mathcal{L}(V,W)$,$TI=IT=T$(前一个 $I$ 是 $V$ 上的恒等算子,后一个是 $W$ 上的);
  • 分配律:$(S_1+S_2)T=S_1T+S_2T$,$S(T_1+T_2)=ST_1+ST_2$。

但乘法没有交换律:即使 $ST$ 和 $TS$ 都有意义,它们也可能不相等。

例𝒫(ℝ) 上两个不可交换的线性映射two noncommuting linear maps from 𝒫(𝐑) to 𝒫(𝐑)3.9

设 $D$ 是微分,$T$ 是「乘以 $x^2$」。则 $((TD)p)(x)=x^2p'(x)$,而 $((DT)p)(x)=x^2p'(x)+2xp(x)$(乘积求导法则多出一项)。所以 $TD\ne DT$:先求导再乘 $x^2$,与先乘 $x^2$ 再求导不是一回事。

具体试一个:$p=x^3$。$TDp=x^2\cdot3x^2=3x^4$,而 $DTp=(x^5)'=5x^4$。

定理线性映射把 0 送到 0linear maps take 0 to 03.10

若 $T\in\mathcal{L}(V,W)$,则 $T(0)=0$。

证明思路

由可加性 $T(0)=T(0+0)=T(0)+T(0)$,两边同加 $-T(0)$ 即得 $T(0)=0$。

这就是为什么 $f(x)=mx+b$ 只有在 $b=0$ 时才是线性映射:「高中代数里的线性函数」和「线性代数里的线性映射」不是一回事。

下列哪个函数 $\mathbf{R}\to\mathbf{R}$ 是线性映射?

线性映射linear map满足 $T(u+v)=Tu+Tv$、$T(\lambda v)=\lambda Tv$ 的函数 $T:V\to W$;几何上是原点不动、网格保持平行等距的变形。
ℒ(V, W)vector space of linear maps从 $V$ 到 $W$ 的全体线性映射;按逐点加法与数乘构成向量空间。$\mathcal{L}(V)=\mathcal{L}(V,V)$。
线性映射引理linear map lemma基 $v_1,\dots,v_n$ 上可任意指定取值 $w_1,\dots,w_n$,且恰有一个线性映射满足 $Tv_k=w_k$。
线性映射的积product of linear maps$ST=S\circ T$:先做 $T$ 再做 $S$。满足结合律、分配律,但一般不可交换。
恒等算子identity operator$I\in\mathcal{L}(V)$,$Iv=v$;是乘法的单位元:$TI=IT=T$。
本节要点
  • 线性 = 可加 + 齐次;两者缺一不可。线性映射一定把 0 送到 0。
  • 线性映射由基上的值唯一决定,而基上的值可以任意指定(3.4)。
  • $\mathcal{L}(V,W)$ 是向量空间;线性映射可以复合(相乘),满足结合律与分配律,但不满足交换律。

3B 零空间与值域 Null Spaces and Ranges

每个线性映射都自带两个子空间:在定义域里,被它压成 0 的向量组成零空间;在目标空间里,它能到达的向量组成值域。零空间衡量 $T$ 丢掉了多少信息,值域衡量 $T$ 覆盖了多大地盘。本节的高潮是把两者联系起来的线性映射基本定理,它会反复出现在本章余下的每一节。

零空间与单射 Null Space and Injectivity

定义零空间null space, null T3.11

对 $T\in\mathcal{L}(V,W)$,$T$ 的零空间是 $V$ 中被 $T$ 映成 0 的向量组成的子集:$\operatorname{null}T=\{v\in V: Tv=0\}$。

null 就是「零」的意思;很多书把零空间叫作核(kernel, ker T)。

例零空间null space3.12
  • 零映射:$\operatorname{null}T=V$(全都被压成 0)。
  • $\varphi\in\mathcal{L}(\mathbf{C}^3,\mathbf{C})$,$\varphi(z_1,z_2,z_3)=z_1+2z_2+3z_3$:$\operatorname{null}\varphi$ 是方程 $z_1+2z_2+3z_3=0$ 的解集——一个「平面」。
  • 微分 $D$:导数为 0 的多项式恰是常数,所以 $\operatorname{null}D=$ 常数多项式。
  • 乘以 $x^2$:$x^2p(x)\equiv0$ 只能 $p=0$,所以零空间是 $\{0\}$。
  • 后移 $T(x_1,x_2,x_3,\dots)=(x_2,x_3,\dots)$:只有第一项可以随便,$\operatorname{null}T=\{(a,0,0,\dots):a\in\mathbf{F}\}$。
定理零空间是子空间the null space is a subspace3.13

若 $T\in\mathcal{L}(V,W)$,则 $\operatorname{null}T$ 是 $V$ 的子空间。

证明思路

用子空间判别法 1.34:$T(0)=0$,所以 $0\in\operatorname{null}T$;若 $Tu=Tv=0$,则 $T(u+v)=Tu+Tv=0$;若 $Tu=0$,则 $T(\lambda u)=\lambda Tu=0$。

定义单射injective3.14

函数 $T:V\to W$ 称为单射,如果 $Tu=Tv$ 蕴含 $u=v$。等价地说:不同的输入给出不同的输出(「不撞车」)。又叫one-to-one(一对一)。

定理单射 ⇔ 零空间只有 0injectivity ⟺ null space equals {0}3.15

设 $T\in\mathcal{L}(V,W)$。则 $T$ 是单射当且仅当 $\operatorname{null}T=\{0\}$。

证明思路

(⇒) 若 $Tv=0=T(0)$,单射给出 $v=0$。(⇐) 若 $Tu=Tv$,则 $T(u-v)=Tu-Tv=0$,于是 $u-v\in\operatorname{null}T=\{0\}$,即 $u=v$。

直觉:只需检查「有没有别人撞上 0」

一般函数要检查「任意两点会不会撞车」,要查无穷多对。线性映射却「处处一个样」:$Tu=Tv$ 等价于 $T(u-v)=0$。把撞车的一对 $(u,v)$ 平移一下,就变成撞上 0 的一对 $(u-v,0)$。所以只要 0 独享它的像,所有点就都独享自己的像。

更进一步:与 $v$ 有相同像的点,恰好是 $v+\operatorname{null}T$(把零空间整体平移到 $v$)。零空间越大,撞在一起的点越多。这个「平移的零空间」在 3E 会成为商空间的元素。

值域与满射 Range and Surjectivity

定义值域range3.16

对 $T\in\mathcal{L}(V,W)$,$T$ 的值域是 $W$ 中能写成 $Tv$ 的向量组成的子集:$\operatorname{range}T=\{Tv: v\in V\}$。很多书叫它像(image, im T)。

例值域range3.17
  • 零映射:$\operatorname{range}T=\{0\}$。
  • $T\in\mathcal{L}(\mathbf{R}^2,\mathbf{R}^3)$,$T(x,y)=(2x,5y,x+y)$:值域 $\{(2x,5y,x+y):x,y\in\mathbf{R}\}$ 是 $\mathbf{R}^3$ 中过原点的一个平面。
  • 微分 $D\in\mathcal{L}(\mathcal{P}(\mathbf{R}))$:每个多项式都有原函数,所以 $\operatorname{range}D=\mathcal{P}(\mathbf{R})$。
定理值域是子空间the range is a subspace3.18

若 $T\in\mathcal{L}(V,W)$,则 $\operatorname{range}T$ 是 $W$ 的子空间。

证明思路

$0=T(0)\in\operatorname{range}T$;若 $w_1=Tv_1$、$w_2=Tv_2$,则 $w_1+w_2=T(v_1+v_2)$;$\lambda w_1=T(\lambda v_1)$。

定义满射surjective3.19

函数 $T:V\to W$ 称为满射,如果 $\operatorname{range}T=W$(「不落空」:$W$ 中每个点都被打到)。又叫onto。

单射 = 不撞车;满射 = 不落空;两者兼备 = 双射(下一节会看到:线性的双射就是可逆映射)。
例满射与否取决于目标空间surjectivity depends on the target space3.20

$D\in\mathcal{L}(\mathcal{P}_5(\mathbf{R}))$,$Dp=p'$ 不是满射($x^5$ 不是任何 5 次以内多项式的导数);但同一个公式定义的 $S\in\mathcal{L}(\mathcal{P}_5(\mathbf{R}),\mathcal{P}_4(\mathbf{R}))$,$Sp=p'$ 是满射——因为它的值域恰好是目标空间 $\mathcal{P}_4(\mathbf{R})$。

零空间与值域:谁被压扁、能到哪里、方程何时有解

右图拖动 $Te_1$(蓝)、$Te_2$(红)的箭头尖来决定 $T:\mathbf{R}^2\to\mathbf{R}^2$(两者接近共线时会自动吸附成共线,得到秩 1 的映射;拖到原点附近会吸附成 0)。左图拖动绿点 $v$:右图绿点是 $Tv$,左图绿色虚线是所有与 $v$ 同像的点 $v+\operatorname{null}T$。右图拖动橙点 $w$:左图橙色画出方程 $Tx=w$ 的全部解。紫色 = 零空间,青色 = 值域。

秩 1 时:左边每一条平行于零空间的直线,都被整条压到右边值域上的同一个点——这就是「不单射」;右边值域只是一条线,把橙点 $w$ 拖离这条线,方程 $Tx=w$ 立刻无解——这就是「不满射」;拖回线上,解是一整条直线(一个特解 + 零空间)。换成可逆的预设:零空间缩成原点,值域铺满平面,每个 $w$ 恰有一个解。无论怎么拖,读数里始终有 $2=\dim\operatorname{null}T+\dim\operatorname{range}T$。

零空间null space (kernel)$\operatorname{null}T=\{v:Tv=0\}$,定义域的子空间;衡量 $T$「压扁」了多少。
值域range (image)$\operatorname{range}T=\{Tv:v\in V\}$,目标空间的子空间;$T$ 能到达的全部向量。
单射injective (one-to-one)$Tu=Tv\Rightarrow u=v$。对线性映射:单射 ⇔ $\operatorname{null}T=\{0\}$。
满射surjective (onto)$\operatorname{range}T=W$;是否满射取决于把哪个空间当目标空间。

线性映射基本定理 Fundamental Theorem of Linear Maps

Axler 说:下一个结果重要到值得一个响亮的名字。

定理线性映射基本定理fundamental theorem of linear maps3.21

设 $V$ 是有限维的,$T\in\mathcal{L}(V,W)$。则 $\operatorname{range}T$ 也是有限维的,并且

$$\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T.$$
证明(完整)

取 $\operatorname{null}T$ 的基 $u_1,\dots,u_m$,把它扩充成 $V$ 的基 $u_1,\dots,u_m,v_1,\dots,v_n$(2.32),于是 $\dim V=m+n$。只需证明 $Tv_1,\dots,Tv_n$ 是 $\operatorname{range}T$ 的基。

张成:任取 $v=a_1u_1+\dots+a_mu_m+b_1v_1+\dots+b_nv_n$,作用 $T$,含 $u_k$ 的项全部消失($Tu_k=0$),得 $Tv=b_1Tv_1+\dots+b_nTv_n$。所以 $Tv_1,\dots,Tv_n$ 张成 $\operatorname{range}T$,特别地 $\operatorname{range}T$ 有限维。

线性无关:若 $c_1Tv_1+\dots+c_nTv_n=0$,则 $T(c_1v_1+\dots+c_nv_n)=0$,即 $c_1v_1+\dots+c_nv_n\in\operatorname{null}T$,可写成 $d_1u_1+\dots+d_mu_m$。移项后得到 $u$ 们与 $v$ 们的一个线性关系;由于它们合起来是基(线性无关),所有 $c$(和 $d$)都为 0。

直觉:维数守恒——每个维度要么被压扁,要么被保留

想象 $T$ 是一台压路机:$V$ 的每个「方向」要么被压成 0(进了零空间),要么被完好地送到 $W$ 里(撑起值域)。不会凭空消失,也不会凭空产生。证明里的做法正是如此:把 $V$ 的基分成「被压扁的部分」$u_1,\dots,u_m$ 和「剩下的部分」$v_1,\dots,v_n$,后者的像恰好是值域的基。

在其他教材里,$\dim\operatorname{range}T$ 叫秩(rank),$\dim\operatorname{null}T$ 叫零化度(nullity),这个定理因此也叫「秩–零化度定理」(rank–nullity theorem)。

第 1 步:找零空间的基

例子:$T\in\mathcal{L}(\mathbf{R}^3,\mathbf{R}^2)$,$T(x,y,z)=(x+y,\ y+z)$。解 $x+y=0,\ y+z=0$ 得 $\operatorname{null}T=\operatorname{span}(u_1)$,$u_1=(1,-1,1)$。所以 $\dim\operatorname{null}T=1$。

第 2 步:扩充成 V 的基

把 $u_1$ 扩充成 $\mathbf{R}^3$ 的基(2.32):$u_1,\ v_1=(1,0,0),\ v_2=(0,0,1)$。基的长度 $3=1+2$:1 个「被压扁的」+ 2 个「剩下的」。

第 3 步:作用 T

$Tu_1=0$(它在零空间里,消失了);$Tv_1=(1,0)$,$Tv_2=(0,1)$。

第 4 步:剩下的像张成值域

任意 $v=a\,u_1+b_1v_1+b_2v_2$,作用 $T$ 后 $u_1$ 那项消失:$Tv=b_1Tv_1+b_2Tv_2$。所以 $Tv_1,Tv_2$ 张成 $\operatorname{range}T$。

第 5 步:它们线性无关

若 $c_1Tv_1+c_2Tv_2=0$,则 $c_1v_1+c_2v_2\in\operatorname{null}T=\operatorname{span}(u_1)$;而 $u_1,v_1,v_2$ 线性无关,只能 $c_1=c_2=0$。(这里 $Tv_1,Tv_2$ 显然无关,但论证对一般情形同样有效。)

第 6 步:数一数

$Tv_1,Tv_2$ 是 $\operatorname{range}T$ 的基,$\dim\operatorname{range}T=2$。于是 $\dim\mathbf{R}^3=3=1+2=\dim\operatorname{null}T+\dim\operatorname{range}T$。顺便得到:$T$ 是满射(值域是 2 维的 $\mathbf{R}^2$),但不是单射。

基本定理的 3D 图像:看 ℝ³ 被「压扁」到值域上

选一个 $T\in\mathcal{L}(\mathbf{R}^3)$,拖动滑块 $t$(或点「播放」)让每个格点从 $p$ 沿直线走到 $Tp$,灰色线框是单位立方体的变形;在图上按住拖动可以旋转视角。紫色是零空间,青色是值域。同色的点最后会叠在一起——它们只相差零空间中的一个向量。

秩 2 的例子沿 $(1,1,1)$ 方向把空间拍扁到 $xy$ 平面:零空间是一条线(1 维),值域是一个平面(2 维),$3=1+2$。秩 1 的例子把与平面 $x+y+z=0$ 平行的每一片都压成 $z$ 轴上的一个点:$3=2+1$。秩 3(原书例 3.62 的变体:绕 $z$ 轴转 90° 再沿 $z$ 拉伸)什么都不压扁:$3=0+3$,立方体只是被转动和拉伸。

基本定理马上给出两个「靠数维数就能下结论」的推论。

定理映到更低维的空间不可能单射linear map to a lower-dimensional space is not injective3.22

设 $V,W$ 有限维且 $\dim V>\dim W$,则任何 $T\in\mathcal{L}(V,W)$ 都不是单射。

证明思路

$\dim\operatorname{null}T=\dim V-\dim\operatorname{range}T\ge\dim V-\dim W>0$(第二步用了 2.37:子空间维数不超过全空间)。零空间非零,由 3.15 不是单射。

例𝐅⁴ → 𝐅³ 的线性映射不是单射linear map from 𝐅⁴ to 𝐅³ is not injective3.23

$T(z_1,z_2,z_3,z_4)=(\sqrt7z_1+\pi z_2+z_4,\ 97z_1+3z_2+2z_3,\ z_2+6z_3+7z_4)$。系数再乱也无所谓:$\dim\mathbf{F}^4>\dim\mathbf{F}^3$,由 3.22,不用任何计算就知道它不是单射。

定理映到更高维的空间不可能满射linear map to a higher-dimensional space is not surjective3.24

设 $V,W$ 有限维且 $\dim V\lt\dim W$,则任何 $T\in\mathcal{L}(V,W)$ 都不是满射。

证明思路

$\dim\operatorname{range}T=\dim V-\dim\operatorname{null}T\le\dim V\lt\dim W$,所以值域不可能是整个 $W$。

维数关系单射可能吗?满射可能吗?一句话
$\dim V>\dim W$✘ 不可能(3.22)可能从大空间挤进小空间,必然有东西被压扁
$\dim V\lt\dim W$可能✘ 不可能(3.24)小空间的像太「薄」,铺不满大空间
$\dim V=\dim W$可能可能而且单射 ⇔ 满射(3D 的 3.65)

应用:线性方程组

把方程组翻译成线性映射的语言,上面两个推论就变成了关于解的存在性的结论。设 $A_{j,k}\in\mathbf{F}$($j=1,\dots,m$;$k=1,\dots,n$),定义 $T:\mathbf{F}^n\to\mathbf{F}^m$:

$$T(x_1,\dots,x_n)=\Big(\sum_{k=1}^nA_{1,k}x_k,\ \dots,\ \sum_{k=1}^nA_{m,k}x_k\Big).$$3.25

那么 $m$ 个方程、$n$ 个未知数的齐次方程组 $\sum_kA_{j,k}x_k=0$($j=1,\dots,m$)就是 $Tx=0$:它有非零解 ⇔ $\operatorname{null}T\ne\{0\}$ ⇔ $T$ 不是单射。而方程组 $\sum_kA_{j,k}x_k=c_j$ 3.27 就是 $Tx=c$:「对所有 $c$ 都有解」⇔ $T$ 是满射。

定理未知数多于方程的齐次方程组有非零解homogeneous system of linear equations3.26

未知数个数多于方程个数($n>m$)的齐次线性方程组必有非零解。例如 4 个方程、5 个未知数的齐次方程组一定有非零解。

证明思路

$T:\mathbf{F}^n\to\mathbf{F}^m$ 且 $n>m$,由 3.22 不是单射。

定理方程多于未知数的方程组对某些常数项无解system of linear equations with more equations than variables3.28

方程个数多于未知数个数($m>n$)时,总能选到常数项 $c_1,\dots,c_m$ 使方程组无解。例如 5 个方程、4 个未知数。

证明思路

$T:\mathbf{F}^n\to\mathbf{F}^m$ 且 $n\lt m$,由 3.24 不是满射:存在 $c\notin\operatorname{range}T$。

历史小注

这两个结论也能用高斯消元法证明,Axler 在页边注里说抽象的方法「证明更干净」。本章扉页的图注还提到:高斯在 1809 年发表了解线性方程组的方法(今称高斯消元法),而这种方法早在 1600 多年前的一部中国典籍里就已使用(通常认为指《九章算术》的「方程」章)。

$T\in\mathcal{L}(\mathbf{R}^5,\mathbf{R}^3)$。关于 $\dim\operatorname{null}T$,一定成立的是?

一个 $T\in\mathcal{L}(\mathbf{R}^7)$ 的零空间是 2 维的。$\operatorname{range}T$ 的维数是?

线性映射基本定理fundamental theorem of linear maps$V$ 有限维时 $\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$:被压扁的维数 + 保留的维数 = 原维数。
齐次方程组homogeneous system常数项全为 0 的方程组 $Tx=0$;未知数多于方程时必有非零解(3.26)。
本节要点
  • 零空间 ⊆ 定义域,值域 ⊆ 目标空间,都是子空间。
  • 单射 ⇔ $\operatorname{null}T=\{0\}$;满射 ⇔ $\operatorname{range}T=W$。与 $v$ 同像的点恰是 $v+\operatorname{null}T$。
  • 基本定理 $\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$ ⇒ 往小空间映射不能单射、往大空间映射不能满射 ⇒ 方程组的两个存在性结论。

3C 矩阵 Matrices

线性映射引理说:$T$ 由 $Tv_1,\dots,Tv_n$ 完全决定。矩阵就是把这些向量用 $W$ 的基写成坐标、一列一列排好的「记账表」。这一节回答:怎样记账?记账表怎样相加、相乘?矩阵的「秩」又是什么?

用矩阵表示线性映射 Representing a Linear Map by a Matrix

定义矩阵,Aj,kmatrix3.29

设 $m,n$ 是非负整数。$m\times n$ 矩阵(原书写作 $m$-by-$n$)$A$ 是由 $\mathbf{F}$ 中元素排成的 $m$ 行 $n$ 列的矩形阵列;$A_{j,k}$ 表示第 $j$ 行、第 $k$ 列的元素——第一个下标是行,第二个是列。例如 3.30 中 $A=\begin{pmatrix}8 & 4 & 5-3i\\ 1 & 9 & 7\end{pmatrix}$,$A_{2,3}=7$。

定义线性映射的矩阵 ℳ(T)matrix of a linear map3.31

设 $T\in\mathcal{L}(V,W)$,$v_1,\dots,v_n$ 是 $V$ 的基,$w_1,\dots,w_m$ 是 $W$ 的基。$T$ 关于这两组基的矩阵是 $m\times n$ 矩阵 $\mathcal{M}(T)$,其元素 $A_{j,k}$ 由下式定义:

$$Tv_k=A_{1,k}w_1+\dots+A_{m,k}w_m\qquad(k=1,\dots,n).$$

基不清楚时写成 $\mathcal{M}\big(T,(v_1,\dots,v_n),(w_1,\dots,w_m)\big)$。

M(T) = v₁ ⋯ vₖ ⋯ vₙ w₁ ⋮ wₘ A₁,ₖ ⋮ Aₘ,ₖ 第 k 列 = Tvₖ 用 w₁,…,wₘ 写出的坐标 上方写定义域的基(列),左侧写目标空间的基(行)
对应原书第 70 页的示意:第 $k$ 列恰好是 $Tv_k$ 的坐标——把第 $k$ 列的每个数乘上左边对应的 $w_j$ 再相加,就得到 $Tv_k$。
一句口诀:列 = 输入的基向量去了哪儿

$\mathcal{M}(T)$ 有多少列,就有多少个输入基向量($\dim V$);有多少行,就有多少个输出坐标($\dim W$)。所以 $n$ 维空间到 $m$ 维空间的线性映射,矩阵是 $m\times n$ 的(先写目标的维数!)。对 $\mathbf{F}^n\to\mathbf{F}^m$,没有特别说明时默认用标准基,于是第 $k$ 列就是 $T(e_k)$——这正是第 3A 节演示里「拖动 $Te_1$、$Te_2$」的意义。

例𝐅² → 𝐅³ 的矩阵3.32

$T(x,y)=(x+3y,\ 2x+5y,\ 7x+9y)$。因为 $T(1,0)=(1,2,7)$,$T(0,1)=(3,5,9)$,所以

$$\mathcal{M}(T)=\begin{pmatrix}1 & 3\\ 2 & 5\\ 7 & 9\end{pmatrix}.$$
例微分 𝒫₃(ℝ) → 𝒫₂(ℝ) 的矩阵3.33

用标准基 $1,x,x^2,x^3$ 与 $1,x,x^2$。$D1=0$,$Dx=1$,$Dx^2=2x$,$Dx^3=3x^2$,逐列写下坐标:

$$\mathcal{M}(D)=\begin{pmatrix}0 & 1 & 0 & 0\\ 0 & 0 & 2 & 0\\ 0 & 0 & 0 & 3\end{pmatrix}.$$
常见误区:矩阵属于「映射 + 两组基」,不只属于映射

同一个 $T$,换一组基,矩阵就变了。例如同一个微分映射 $D$,若 $\mathcal{P}_3(\mathbf{R})$ 用基 $x,\ \tfrac{x^2}{2},\ \tfrac{x^3}{3},\ 1$、$\mathcal{P}_2(\mathbf{R})$ 仍用 $1,x,x^2$,矩阵就变成 $\begin{pmatrix}1&0&0&0\\0&1&0&0\\0&0&1&0\end{pmatrix}$(习题 3C.4)。后面各章的一个核心主题就是:挑选合适的基,让矩阵尽可能简单。

矩阵的加法与数乘 Addition and Scalar Multiplication of Matrices

从这里到本节末尾,假设 $U$、$V$、$W$ 都是有限维的,并各自取定了一组基;所有矩阵都相对于这些基。

定义矩阵的加法与数乘matrix addition; scalar multiplication of a matrix3.343.36

同型矩阵相加 = 对应元素相加;数乘 = 每个元素乘以这个数。例 3.37:

$$2\begin{pmatrix}3 & 1\\ -1 & 5\end{pmatrix}+\begin{pmatrix}4 & 2\\ 1 & 6\end{pmatrix}=\begin{pmatrix}6 & 2\\ -2 & 10\end{pmatrix}+\begin{pmatrix}4 & 2\\ 1 & 6\end{pmatrix}=\begin{pmatrix}10 & 4\\ -1 & 16\end{pmatrix}.$$
定理和与数乘的矩阵matrix of the sum of linear maps; the matrix of a scalar times a linear map3.353.38

$\mathcal{M}(S+T)=\mathcal{M}(S)+\mathcal{M}(T)$,$\mathcal{M}(\lambda T)=\lambda\mathcal{M}(T)$(三个映射用同一对基)。也就是说,取矩阵这个操作 $\mathcal{M}$ 本身是线性的。

定理dim 𝐅m,n = mndim 𝐅m,n = mn3.393.40

全体 $m\times n$ 矩阵记作 $\mathbf{F}^{m,n}$。在上述加法与数乘下它是 $mn$ 维向量空间:只有一个位置是 1、其余是 0 的 $mn$ 个矩阵构成一组基。

矩阵乘法 Matrix Multiplication

设 $T:U\to V$、$S:V\to W$,基分别是 $u_1,\dots,u_p$、$v_1,\dots,v_n$、$w_1,\dots,w_m$,$\mathcal{M}(S)=A$,$\mathcal{M}(T)=B$。我们希望 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$——于是就按这个愿望去定义矩阵乘法。计算 $ST$ 作用在 $u_k$ 上:

$$(ST)u_k=S\Big(\sum_{r=1}^nB_{r,k}v_r\Big)=\sum_{r=1}^nB_{r,k}\,Sv_r=\sum_{j=1}^m\Big(\sum_{r=1}^nA_{j,r}B_{r,k}\Big)w_j.$$

所以 $\mathcal{M}(ST)$ 第 $j$ 行第 $k$ 列的元素必须是 $\sum_rA_{j,r}B_{r,k}$。

定义矩阵乘法matrix multiplication3.41

设 $A$ 是 $m\times n$ 矩阵,$B$ 是 $n\times p$ 矩阵。$AB$ 是 $m\times p$ 矩阵,其元素为

$$(AB)_{j,k}=\sum_{r=1}^nA_{j,r}B_{r,k}.$$

即:取 $A$ 的第 $j$ 行与 $B$ 的第 $k$ 列,对应相乘再相加。只有当 $A$ 的列数等于 $B$ 的行数时才能相乘。

例矩阵乘法matrix multiplication3.42
$$\begin{pmatrix}1 & 2\\ 3 & 4\\ 5 & 6\end{pmatrix}\begin{pmatrix}6 & 5 & 4 & 3\\ 2 & 1 & 0 & -1\end{pmatrix}=\begin{pmatrix}10 & 7 & 4 & 1\\ 26 & 19 & 12 & 5\\ 42 & 31 & 20 & 9\end{pmatrix}.$$

$(3\times2)$ 乘 $(2\times4)$ 得 $(3\times4)$;例如第 2 行第 1 列 $=3\cdot6+4\cdot2=26$。

定理积的矩阵 = 矩阵的积matrix of product of linear maps3.43

若 $T\in\mathcal{L}(U,V)$、$S\in\mathcal{L}(V,W)$,则 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$。(证明就是上面那段动机计算。)

直觉:那个「奇怪」的乘法公式,是为复合量身定做的

许多人第一次学矩阵乘法时觉得公式莫名其妙。Axler 的角度让它变得必然:矩阵乘法就是映射复合的记账方式。尺寸规则也一目了然:$U\xrightarrow{T}V\xrightarrow{S}W$,维数 $p\to n\to m$,于是 $(m\times n)(n\times p)=m\times p$,中间的 $n$ 像多米诺骨牌一样「对上」才能接。而由于复合一般不可交换,矩阵乘法一般也不可交换(习题 3C.10),但满足分配律与结合律(习题 3C.11、3C.12)。

矩阵乘法 = 映射复合:先 T 后 S,与先 S 后 T 不一样

选两个线性映射 $S$、$T$,拖动「进度」滑块(或点「播放」):前半程做第一个映射,后半程接着做第二个。左图是 $ST$(先 $T$ 后 $S$),右图是 $TS$(先 $S$ 后 $T$)。黄色的「F」能看出朝向;蓝、红箭头是 $e_1$、$e_2$ 的去向,它们最终停在乘积矩阵的两列上。

默认的「旋转 90°」与「剪切」:两幅图终点完全不同,读数里 $\mathcal{M}(S)\mathcal{M}(T)\ne\mathcal{M}(T)\mathcal{M}(S)$。乘积矩阵的第 1 列就是蓝箭头的终点 $(ST)e_1=S(Te_1)$。把其中一个换成「缩放 ×1.5」,两幅图变得一模一样——数乘恒等映射与一切映射可交换(原书习题 3A.11 说:有限维时只有它们如此)。

矩阵乘法还有几种等价的「看法」,在证明和计算里都很好用。先引入记号:

记号Aj,· 与 A·,k3.443.45

$A_{j,\cdot}$ 表示 $A$ 的第 $j$ 行($1\times n$ 矩阵),$A_{\cdot,k}$ 表示第 $k$ 列($m\times1$ 矩阵)。例如 $A=\begin{pmatrix}8 & 4 & 5\\ 1 & 9 & 7\end{pmatrix}$ 时,$A_{2,\cdot}=\begin{pmatrix}1 & 9 & 7\end{pmatrix}$,$A_{\cdot,2}=\begin{pmatrix}4\\ 9\end{pmatrix}$。$1\times1$ 矩阵与它的元素视为同一个东西,例如 $\begin{pmatrix}3 & 4\end{pmatrix}\begin{pmatrix}6\\ 2\end{pmatrix}=26$。

看法公式一句话原书
元素 = 行 × 列$(AB)_{j,k}=A_{j,\cdot}B_{\cdot,k}$第 $j$ 行与第 $k$ 列对应相乘再求和3.46、3.47
列 = 矩阵 × 列$(AB)_{\cdot,k}=AB_{\cdot,k}$$AB$ 的每一列是 $A$ 作用在 $B$ 的对应列上3.48
$Ab$ = 列的组合$Ab=b_1A_{\cdot,1}+\dots+b_nA_{\cdot,n}$$b$ 的分量是 $A$ 各列的「配方」3.49、3.50
行 = 行 × 矩阵$(AB)_{j,\cdot}=A_{j,\cdot}B$,$aB=\sum a_rB_{r,\cdot}$$AB$ 的每一行是 $B$ 各行的组合习题 3C.8、3C.9
例3×2 矩阵乘 2×1 矩阵product of a 3-by-2 matrix and a 2-by-1 matrix3.49
$$\begin{pmatrix}1 & 2\\ 3 & 4\\ 5 & 6\end{pmatrix}\begin{pmatrix}5\\ 1\end{pmatrix}=\begin{pmatrix}7\\ 19\\ 31\end{pmatrix}=5\begin{pmatrix}1\\ 3\\ 5\end{pmatrix}+1\begin{pmatrix}2\\ 4\\ 6\end{pmatrix}.$$

乘积是各列的线性组合,系数(5 和 1)来自右边的列向量——这就是 3.50「列的线性组合」(linear combination of columns)。

定理矩阵乘法 = 列的组合 或 行的组合matrix multiplication as linear combinations of columns or rows3.51

设 $C$ 是 $m\times c$ 矩阵,$R$ 是 $c\times n$ 矩阵。

(a) $CR$ 的第 $k$ 列是 $C$ 的各列的线性组合,系数来自 $R$ 的第 $k$ 列;

(b) $CR$ 的第 $j$ 行是 $R$ 的各行的线性组合,系数来自 $C$ 的第 $j$ 行。

证明思路

(a) 由 3.48,$CR$ 的第 $k$ 列 $=CR_{\cdot,k}$,再由 3.50 它是 $C$ 各列以 $R_{\cdot,k}$ 为系数的组合。(b) 同理,改用行的版本(习题 3C.8、3C.9)。

列–行分解与矩阵的秩 Column–Row Factorization and Rank of a Matrix

定义列秩、行秩column rank, row rank3.52

设 $A$ 是 $m\times n$ 矩阵。$A$ 的列秩是 $A$ 的各列在 $\mathbf{F}^{m,1}$ 中张成的子空间的维数;行秩是各行在 $\mathbf{F}^{1,n}$ 中张成的子空间的维数。两者都不超过 $\min\{m,n\}$。

例2×4 矩阵的列秩与行秩column rank and row rank of a 2-by-4 matrix3.53

$A=\begin{pmatrix}4 & 7 & 1 & 8\\ 3 & 5 & 2 & 9\end{pmatrix}$。前两列 $(4,3)^{\mathrm t}$、$(7,5)^{\mathrm t}$ 不成比例,所以列张成的空间至少 2 维;它又在 2 维的 $\mathbf{F}^{2,1}$ 里,所以列秩 = 2。两行不成比例,行秩也是 2。

定义转置 Attranspose3.54

把 $A$ 的行与列互换得到转置 $A^{\mathrm t}$:$(A^{\mathrm t})_{k,j}=A_{j,k}$。例 3.55:$\begin{pmatrix}5 & -7\\ 3 & 8\\ -4 & 2\end{pmatrix}^{\mathrm t}=\begin{pmatrix}5 & 3 & -4\\ -7 & 8 & 2\end{pmatrix}$。性质:$(A+B)^{\mathrm t}=A^{\mathrm t}+B^{\mathrm t}$,$(\lambda A)^{\mathrm t}=\lambda A^{\mathrm t}$,$(AC)^{\mathrm t}=C^{\mathrm t}A^{\mathrm t}$(注意顺序反了;习题 3C.14、3C.15)。

定理列–行分解column–row factorization3.56

设 $A$ 是 $m\times n$ 矩阵,列秩 $c\ge1$。则存在 $m\times c$ 矩阵 $C$ 和 $c\times n$ 矩阵 $R$ 使得 $A=CR$。

证明思路

把 $A$ 的列组成的组 $A_{\cdot,1},\dots,A_{\cdot,n}$ 缩减成它们张成空间的一组基(2.30:从左到右删去能被前面表示的列)。这组基恰有 $c$ 个向量,把它们并排放成 $m\times c$ 矩阵 $C$。$A$ 的每一列都是 $C$ 的列的线性组合,把第 $k$ 列的组合系数写成 $c\times n$ 矩阵 $R$ 的第 $k$ 列。由 3.51(a),$A=CR$。

定理列秩 = 行秩column rank equals row rank3.57

对任意 $A\in\mathbf{F}^{m,n}$,$A$ 的列秩等于行秩。

证明思路

设列秩为 $c$($c=0$ 时 $A=0$,平凡)。取列–行分解 $A=CR$。由 3.51(b),$A$ 的每一行都是 $R$ 的 $c$ 行的线性组合,所以行秩 $\le c$ = 列秩。对 $A^{\mathrm t}$ 用同样的结论:列秩$(A)$ = 行秩$(A^{\mathrm t})\le$ 列秩$(A^{\mathrm t})$ = 行秩$(A)$。两个不等式合起来就是相等。

列–行分解 A = CR:点一列、点一行,看「列秩 = 行秩」从哪里来

上方可直接改矩阵 $A$ 的元素(−9 到 9 的整数),或选一个预设。下方自动给出 $A=CR$:$C$ 由 $A$ 中从左到右「不能被前面的列表示」的列组成($A$ 中用蓝框标出),$R$ 的第 $k$ 列记录「$A$ 的第 $k$ 列怎样用 $C$ 的列拼出来」。点 $A$ 上方的「列 k」看列的组合(定理 3.51(a)),点左侧的「行 j」看行的组合(定理 3.51(b))。

编辑 A:

$C$ 有几列,列秩就是几;而 $A$ 的每一行都只是 $R$ 的那几行的组合,所以行秩不可能更大——转置一下再用一次,就得到「列秩 = 行秩」。试试「秩 1」:$C$ 只有一列,$R$ 只有一行,$A$ 的每一行都与 $R$ 那一行成比例,每一列都与 $C$ 那一列成比例(习题 3C.16:秩 1 矩阵都形如「列 × 行」)。

定义秩rank3.58

既然列秩 = 行秩,就统一叫作矩阵的秩:$A\in\mathbf{F}^{m,n}$ 的秩 = 它的列秩。(3.133 会用对偶给出另一个证明;原书习题 7A.8 还有第三个。)

微分映射 $D:\mathcal{P}_3(\mathbf{R})\to\mathcal{P}_2(\mathbf{R})$ 关于标准基的矩阵是几行几列?

线性映射的矩阵matrix of a linear map$\mathcal{M}(T)$ 的第 $k$ 列 = $Tv_k$ 在 $w_1,\dots,w_m$ 下的坐标;依赖于两组基的选择。
矩阵乘法matrix multiplication$(AB)_{j,k}=\sum_rA_{j,r}B_{r,k}$;为使 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$ 而定义,一般不可交换。
列秩 / 行秩column rank / row rank各列(各行)张成的空间的维数;两者总相等(3.57)。
转置transpose$(A^{\mathrm t})_{k,j}=A_{j,k}$:行列互换;$(AC)^{\mathrm t}=C^{\mathrm t}A^{\mathrm t}$。
列–行分解column–row factorization$A=CR$:$C$ 是 $A$ 的一组「基列」,$R$ 记录每列的组合系数;$C$ 的列数 = 秩。
秩rank矩阵的列秩(= 行秩);对线性映射,$\mathcal{M}(T)$ 的秩 = $\dim\operatorname{range}T$(3.78)。
本节要点
  • $\mathcal{M}(T)$ 的第 $k$ 列 = $Tv_k$ 的坐标;$m\times n$ 对应 $n$ 维 → $m$ 维。矩阵依赖于基的选择。
  • 矩阵的加法、数乘、乘法都是「照着线性映射的运算」定义的:$\mathcal{M}(S+T)=\mathcal{M}(S)+\mathcal{M}(T)$,$\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$。
  • $Ab$ 是 $A$ 各列的组合;$CR$ 的列是 $C$ 的列的组合、行是 $R$ 的行的组合。由列–行分解得出列秩 = 行秩。

3D 可逆性与同构 Invertibility and Isomorphisms

什么时候一个线性映射能「倒回去」?什么时候两个向量空间「本质上是同一个」?本节的答案最后都归结为数维数:可逆 ⇔ 单射 + 满射;有限维且维数相同时,单射、满射、可逆三者等价;有限维空间同构 ⇔ 维数相同。最后,我们用这些工具看清:换一组基,矩阵怎样变。

可逆线性映射 Invertible Linear Maps

定义可逆,逆invertible, inverse3.59

$T\in\mathcal{L}(V,W)$ 称为可逆的,如果存在 $S\in\mathcal{L}(W,V)$ 使得 $ST$ 是 $V$ 上的恒等算子、$TS$ 是 $W$ 上的恒等算子。这样的 $S$ 叫 $T$ 的一个逆。

定理逆是唯一的inverse is unique3.60

可逆线性映射的逆是唯一的,于是可以记作 $T^{-1}$ 3.61:它是 $\mathcal{L}(W,V)$ 中唯一满足 $T^{-1}T=I$、$TT^{-1}=I$ 的元素。

证明思路

若 $S_1,S_2$ 都是逆,则 $S_1=S_1I=S_1(TS_2)=(S_1T)S_2=IS_2=S_2$。只用到了结合律。

例ℝ³ → ℝ³ 线性映射的逆inverse of a linear map from 𝐑³ to 𝐑³3.62

$T(x,y,z)=(-y,\ x,\ 4z)$:在 $xy$ 平面内逆时针转 90°,并沿 $z$ 轴拉伸 4 倍。倒回去就是顺时针转 90°、沿 $z$ 轴压缩到 $\tfrac14$:$T^{-1}(x,y,z)=(y,\ -x,\ \tfrac14z)$。(3B 的 3D 演示里「秩 3」那个预设就是它的变体。)

定理可逆 ⇔ 单射且满射invertibility ⟺ injectivity and surjectivity3.63

线性映射可逆当且仅当它既是单射又是满射。

证明思路

(⇒) 若 $Tu=Tv$,两边作用 $T^{-1}$ 得 $u=v$(单射);任取 $w$,$w=T(T^{-1}w)$ 在值域中(满射)。

(⇐) 对每个 $w\in W$,满射保证有 $v$ 使 $Tv=w$,单射保证这样的 $v$ 唯一,记为 $S(w)$。显然 $TS=I$;又 $T\big((ST)v\big)=(TS)(Tv)=Tv$,由单射得 $(ST)v=v$。最微妙的一步是 $S$ 自动是线性的:$T\big(S(w_1)+S(w_2)\big)=w_1+w_2$,所以 $S(w_1)+S(w_2)$ 就是那个被映到 $w_1+w_2$ 的唯一元素,即 $S(w_1+w_2)$;齐次性同理。

直觉:可逆 = 不撞车 + 不落空

回到 3B 的图:单射保证「倒回去」时每个输出只对应一个输入,满射保证每个输出都有输入可回。两者兼备时,倒过来的函数不仅存在,还自动是线性的——线性映射的逆不需要另外检查线性。

对从 $V$ 到自身的映射,你也许会问:单射、满射,是否有一个就够了?在无穷维空间里不够:

例单射或满射单独都推不出可逆neither injectivity nor surjectivity implies invertibility3.64
  • $\mathcal{P}(\mathbf{R})$ 上的「乘以 $x^2$」是单射,但不是满射(常数 1 不在值域中),所以不可逆。
  • $\mathbf{F}^\infty$ 上的后移是满射,但不是单射($(1,0,0,\dots)$ 在零空间中),所以不可逆。

对比之下,下面这个结果相当惊人:在有限维且维数相同时,单射与满射中任何一个都能推出另一个。

定理同维有限维时:单射 ⇔ 满射 ⇔ 可逆injectivity is equivalent to surjectivity (if dim V = dim W < ∞)3.65

设 $V,W$ 有限维,$\dim V=\dim W$,$T\in\mathcal{L}(V,W)$。则

$$T\ \text{可逆}\iff T\ \text{是单射}\iff T\ \text{是满射}.$$

特别地,当 $V$ 有限维而 $W=V$ 时(算子),条件 $\dim V=\dim W$ 自动成立。

证明思路

基本定理 3.66:$\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$。单射 ⇔ $\dim\operatorname{null}T=0$ ⇔ $\dim\operatorname{range}T=\dim V=\dim W$ ⇔ $\operatorname{range}T=W$(2.39:满维数的子空间就是全空间)⇔ 满射。两者等价,于是其中一个成立时两个都成立,即可逆。

有限维、$\dim V=\dim W$无穷维(如 $\mathcal{P}(\mathbf{R})$、$\mathbf{F}^\infty$)
单射 ⇒ 满射?✔(3.65)✘ 乘以 $x^2$
满射 ⇒ 单射?✔(3.65)✘ 后移
$ST=I$ ⇒ $TS=I$?✔(3.68)✘ 例:$S$ 为后移,$T(x_1,x_2,\dots)=(0,x_1,x_2,\dots)$,则 $ST=I$ 但 $TS\ne I$
例存在多项式 p 使 ((x²+5x+7)p)″ = qthere exists a polynomial p such that ((x² + 5x + 7)p)″ = q3.67

映射 $p\mapsto\big((x^2+5x+7)p\big)''$ 在 $\mathcal{P}(\mathbf{R})$ 上是单射,但 3.64 告诉我们:无穷维时单射推不出满射。技巧:限制到有限维。给定 $q$,取 $m$ 使 $q\in\mathcal{P}_m(\mathbf{R})$,定义 $T:\mathcal{P}_m(\mathbf{R})\to\mathcal{P}_m(\mathbf{R})$,$Tp=\big((x^2+5x+7)p\big)''$——乘 $x^2+5x+7$ 升 2 次,求两次导又降 2 次,所以确实映到 $\mathcal{P}_m(\mathbf{R})$ 自身。二阶导为 0 的多项式形如 $ax+b$,而非零的 $(x^2+5x+7)p$ 次数至少为 2,所以 $\operatorname{null}T=\{0\}$,$T$ 是单射,由 3.65 也是满射:存在 $p$ 使 $\big((x^2+5x+7)p\big)''=q$。

定理同维时 ST = I ⇔ TS = IST = I ⟺ TS = I (on vector spaces of the same dimension)3.68

设 $V,W$ 是维数相同的有限维空间,$S\in\mathcal{L}(W,V)$,$T\in\mathcal{L}(V,W)$。则 $ST=I\iff TS=I$。所以对有限维空间上的算子,「左逆」自动是「右逆」——尽管一般的算子乘法不可交换。

证明思路

若 $ST=I$:$Tv=0\Rightarrow v=S(Tv)=0$,$T$ 单射,由 3.65 可逆;在 $ST=I$ 两边右乘 $T^{-1}$ 得 $S=T^{-1}$,所以 $TS=I$。反方向交换 $S,T$ 的角色。

$\mathcal{P}(\mathbf{R})$ 上的映射 $p\mapsto x^2p$ 是单射。它可逆吗?

同构的向量空间 Isomorphic Vector Spaces

定义同构,同构的isomorphism, isomorphic3.69

同构就是可逆线性映射。如果存在从 $V$ 到 $W$ 的同构,就说 $V$ 与 $W$ 是同构的。

把同构 $T:V\to W$ 想成「把 $v$ 改名叫 $Tv$」:换了名字,所有向量空间性质(加法、数乘、线性无关、维数……)原封不动。想强调「两个空间本质相同」时说「同构」,想强调映射时说「可逆」。

定理维数决定是否同构dimension shows whether vector spaces are isomorphic3.70

$\mathbf{F}$ 上的两个有限维向量空间同构,当且仅当它们维数相同。

证明思路

(⇒) 同构 $T$ 满足 $\operatorname{null}T=\{0\}$、$\operatorname{range}T=W$,代入基本定理得 $\dim V=\dim W$。(⇐) 取两组基 $v_1,\dots,v_n$ 与 $w_1,\dots,w_n$,令 $T(\sum c_kv_k)=\sum c_kw_k$:$w$ 们张成 $W$ 所以满射,$w$ 们线性无关所以零空间为 $\{0\}$。

直觉:一个数字就判定了「本质相同」

判断两个群、两个拓扑空间是否「本质相同」往往很难;向量空间却只需看一个数——维数。所以每个 $n$ 维空间都同构于 $\mathbf{F}^n$,例如 $\mathcal{P}_m(\mathbf{F})\cong\mathbf{F}^{m+1}$(把多项式换成系数表)。Axler 在页边注里问:那为什么不只研究 $\mathbf{F}^n$?因为研究 $\mathbf{F}^n$ 很快就会遇到零空间、值域这些新的空间;把它们都硬说成某个 $\mathbf{F}^m$,只会增加复杂性而没有新见解。

定理ℒ(V,W) 与 𝐅m,n 同构ℒ(V, W) and 𝐅m,n are isomorphic3.71

取定 $V$ 的基 $v_1,\dots,v_n$ 与 $W$ 的基 $w_1,\dots,w_m$,则 $\mathcal{M}:\mathcal{L}(V,W)\to\mathbf{F}^{m,n}$ 是同构。

证明思路

$\mathcal{M}$ 线性(3.35、3.38)。单射:若 $\mathcal{M}(T)=0$,则所有 $Tv_k=0$,所以 $T=0$。满射:任给矩阵 $A$,由线性映射引理 3.4 存在 $T$ 使 $Tv_k=\sum_jA_{j,k}w_j$,即 $\mathcal{M}(T)=A$。

定理dim ℒ(V,W) = (dim V)(dim W)dim ℒ(V, W) = (dim V)(dim W)3.72

若 $V,W$ 有限维,则 $\mathcal{L}(V,W)$ 有限维,且 $\dim\mathcal{L}(V,W)=(\dim V)(\dim W)$。(由 3.71、3.70、3.40 立得:一个线性映射 = $mn$ 个可以自由选择的数。)

下列哪一对向量空间是同构的?

把线性映射看作矩阵乘法 Linear Maps Thought of as Matrix Multiplication

定义向量的矩阵 ℳ(v)matrix of a vector3.73

设 $v_1,\dots,v_n$ 是 $V$ 的基,$v=b_1v_1+\dots+b_nv_n$。$v$ 关于这组基的矩阵是 $n\times1$ 矩阵 $\mathcal{M}(v)=\begin{pmatrix}b_1\\ \vdots\\ b_n\end{pmatrix}$——也就是 $v$ 的坐标列。

例 3.74:$2-7x+5x^3+x^4$ 关于 $\mathcal{P}_4(\mathbf{R})$ 标准基的矩阵是 $(2,-7,0,5,1)^{\mathrm t}$(注意 $x^2$ 的系数 0 也要写);$\mathbf{F}^n$ 中的 $x$ 关于标准基的矩阵就是把坐标竖着写。取定基之后,$v\mapsto\mathcal{M}(v)$ 是 $V$ 到 $\mathbf{F}^{n,1}$ 的同构——「给向量贴上坐标标签」。

定理ℳ(T) 的第 k 列 = ℳ(Tvk)ℳ(T)·,k = ℳ(Tvk)3.75

这只是把定义 3.31 用新记号重说一遍。

定理线性映射的作用就像矩阵乘法linear maps act like matrix multiplication3.76

设 $T\in\mathcal{L}(V,W)$,$v\in V$,$V$、$W$ 各取定一组基。则

$$\mathcal{M}(Tv)=\mathcal{M}(T)\,\mathcal{M}(v).$$
证明思路

设 $v=\sum b_kv_k$,则 $Tv=\sum b_kTv_k$ 3.77。取坐标($\mathcal{M}$ 线性):$\mathcal{M}(Tv)=\sum b_k\mathcal{M}(Tv_k)=\sum b_k\mathcal{M}(T)_{\cdot,k}=\mathcal{M}(T)\mathcal{M}(v)$,最后一步是 3.50「列的线性组合」。

v ∈ V Tv ∈ W M(v):n×1 坐标列 M(Tv):m×1 坐标列 T 乘 M(T) 取坐标 取坐标 两条路走到右下角结果相同:先作用 T 再取坐标 = 先取坐标再乘矩阵
3.76 的交换图:取定基之后,每个有限维空间之间的线性映射都可以「改名」成矩阵乘法 $x\mapsto Ax$。
Axler 的立场

3.76 允许我们把任何(有限维之间的)线性映射都看成「乘以某个矩阵 $A$」,但要记住:$A$ 不仅取决于映射,还取决于基的选择。后面许多重要结果的主题就是:挑一组基,使 $A$ 尽可能简单。本书以线性映射而非矩阵为中心,但需要时也会把线性映射当矩阵看(反之亦然),以获得洞见。

定理dim range T = ℳ(T) 的列秩dimension of range T equals column rank of ℳ(T)3.78

设 $V,W$ 有限维,$T\in\mathcal{L}(V,W)$。则对任意基的选择,$\dim\operatorname{range}T$ 都等于 $\mathcal{M}(T)$ 的列秩。(所以列秩与基的选择无关——值域本身与基无关。)

证明思路

$\operatorname{range}T=\operatorname{span}(Tv_1,\dots,Tv_n)$(习题 3B.10)。取坐标的同构 $w\mapsto\mathcal{M}(w)$ 把它同构地映到 $\operatorname{span}\big(\mathcal{M}(Tv_1),\dots,\mathcal{M}(Tv_n)\big)$,而 $\mathcal{M}(Tv_k)$ 正是 $\mathcal{M}(T)$ 的第 $k$ 列。同构保持维数。

基变换 Change of Basis

对算子 $T\in\mathcal{L}(V)$,通常在定义域和目标空间用同一组基,简记 $\mathcal{M}\big(T,(v_1,\dots,v_n)\big)=\mathcal{M}\big(T,(v_1,\dots,v_n),(v_1,\dots,v_n)\big)$。现在的问题是:同一个算子,在两组不同的基下的矩阵有什么关系?

定义单位矩阵;可逆矩阵与逆矩阵identity matrix; invertible, inverse3.793.80

对角线上是 1、其余是 0 的 $n\times n$ 矩阵叫单位矩阵 $I$(它就是恒等算子关于任何基的矩阵:$\mathcal{M}(I)=I$)。方阵 $A$ 称为可逆的,如果存在同阶方阵 $B$ 使 $AB=BA=I$;$B$ 唯一,记作 $A^{-1}$。可逆也叫nonsingular(非奇异),不可逆叫singular(奇异)。性质:$(A^{-1})^{-1}=A$;$(AC)^{-1}=C^{-1}A^{-1}$(穿衣服与脱衣服,顺序相反)。

定理积的矩阵(写明各组基)matrix of product of linear maps3.81

$\mathcal{M}\big(ST,(u),(w)\big)=\mathcal{M}\big(S,(v),(w)\big)\,\mathcal{M}\big(T,(u),(v)\big)$——就是 3.43,只是把中间那组基 $(v)$ 写清楚:左边矩阵的「输入基」必须等于右边矩阵的「输出基」。

定理恒等算子关于两组基的矩阵matrix of identity operator with respect to two bases3.82

设 $u_1,\dots,u_n$ 与 $v_1,\dots,v_n$ 都是 $V$ 的基。则 $\mathcal{M}\big(I,(u),(v)\big)$ 与 $\mathcal{M}\big(I,(v),(u)\big)$ 都可逆,且互为逆矩阵。注意 $\mathcal{M}\big(I,(u),(v)\big)$ 的第 $k$ 列是把 $u_k$ 用 $v$ 基写出的坐标——它是一张「坐标翻译表」。

证明思路

在 3.81 中令 $S=T=I$、$w=u$:$I=\mathcal{M}(I,(v),(u))\mathcal{M}(I,(u),(v))$;再交换 $u,v$ 的角色得另一个方向。

例𝐅² 上恒等算子关于两组基的矩阵matrix of identity operator on 𝐅² with respect to two bases3.83

基 $(4,2),(5,3)$ 与标准基 $(1,0),(0,1)$。因为 $(4,2)=4(1,0)+2(0,1)$、$(5,3)=5(1,0)+3(0,1)$:

$$\mathcal{M}\big(I,((4,2),(5,3)),((1,0),(0,1))\big)=\begin{pmatrix}4 & 5\\ 2 & 3\end{pmatrix},\qquad \mathcal{M}\big(I,((1,0),(0,1)),((4,2),(5,3))\big)=\begin{pmatrix}4 & 5\\ 2 & 3\end{pmatrix}^{-1}=\begin{pmatrix}\tfrac32 & -\tfrac52\\ -1 & 2\end{pmatrix}.$$
定理基变换公式change-of-basis formula3.84

设 $T\in\mathcal{L}(V)$,$u_1,\dots,u_n$ 与 $v_1,\dots,v_n$ 是 $V$ 的两组基。记 $A=\mathcal{M}\big(T,(u)\big)$,$B=\mathcal{M}\big(T,(v)\big)$,$C=\mathcal{M}\big(I,(u),(v)\big)$。则

$$A=C^{-1}BC.$$
证明思路

用两次 3.81:$A=\mathcal{M}(IT,(u),(u))=\mathcal{M}(I,(v),(u))\,\mathcal{M}(T,(u),(v))=C^{-1}\mathcal{M}(T,(u),(v))$ 3.85;又 $\mathcal{M}(T,(u),(v))=\mathcal{M}(TI,(u),(v))=\mathcal{M}(T,(v),(v))\,\mathcal{M}(I,(u),(v))=BC$。代入即得。

直觉:从右往左读,是一条「翻译 → 计算 → 翻译回来」的路

$C^{-1}BC$ 作用在一个 $u$ 坐标列上:先用 $C$ 把 $u$ 坐标翻译成 $v$ 坐标,再用 $B$ 在 $v$ 坐标里计算 $T$,最后用 $C^{-1}$ 把结果翻译回 $u$ 坐标。整条路的效果与直接用 $A$ 在 $u$ 坐标里计算相同。下面的步骤播放器用例 3.83 的数字走一遍。

第 1 步:一个向量的 u 坐标

取 $u_1=(4,2)$,$u_2=(5,3)$,$v$ 是标准基,$B=\mathcal{M}(T,(v))=\begin{pmatrix}1&2\\0&3\end{pmatrix}$。设 $x$ 的 $u$ 坐标是 $\mathcal{M}(x)=(1,1)^{\mathrm t}$,即 $x=u_1+u_2$。

第 2 步:乘 C,翻译成标准坐标

$C=\begin{pmatrix}4&5\\2&3\end{pmatrix}$ 的两列就是 $u_1,u_2$ 的标准坐标。$C(1,1)^{\mathrm t}=(9,5)^{\mathrm t}$:$x=(9,5)$。

第 3 步:乘 B,在标准坐标里计算 T

$B(9,5)^{\mathrm t}=(9+10,\ 15)^{\mathrm t}=(19,15)^{\mathrm t}$:$Tx=(19,15)$。

第 4 步:乘 C⁻¹,翻译回 u 坐标

$C^{-1}=\begin{pmatrix}\tfrac32&-\tfrac52\\-1&2\end{pmatrix}$,$C^{-1}(19,15)^{\mathrm t}=(-9,\ 11)^{\mathrm t}$。验证:$-9u_1+11u_2=(-36+55,\ -18+33)=(19,15)$ ✔。

第 5 步:与 A 直接计算对比

$A=C^{-1}BC=\begin{pmatrix}-3&-6\\4&7\end{pmatrix}$,$A(1,1)^{\mathrm t}=(-9,11)^{\mathrm t}$——与绕一圈的结果相同。这就是 $A=C^{-1}BC$。

基变换:同一个算子,换一副「坐标眼镜」

算子 $T$ 固定(用下拉框选),紫色斜网格是新基 $u_1,u_2$ 的坐标网格。拖动 $u_1$(蓝)、$u_2$(红)来换基,虚线箭头是 $Tu_1$、$Tu_2$;拖动绿点 $x$ 看它的新坐标。读数给出 $B=\mathcal{M}(T,\text{标准基})$、$C=\mathcal{M}(I,(u),(e))=\begin{pmatrix}u_1 & u_2\end{pmatrix}$ 与 $A=C^{-1}BC=\mathcal{M}(T,(u))$。然后点「用特征向量作基」!

$A$ 的第 1 列就是 $Tu_1$ 在斜网格上读出的坐标。对「对称」和「上三角」两个算子,点「用特征向量作基」后 $Tu_1$、$Tu_2$ 分别与 $u_1$、$u_2$ 共线,$A$ 变成对角矩阵——在这副眼镜下,$T$ 只是沿两个方向各自拉伸。这正是第 5 章(特征值与特征向量)的主题。剪切只有一个特征方向,旋转 90° 没有实特征方向:它们在 $\mathbf{R}^2$ 上找不到这样的基。

定理逆的矩阵 = 矩阵的逆matrix of inverse equals inverse of matrix3.86

若 $T\in\mathcal{L}(V)$ 可逆,则关于同一组基 $\mathcal{M}(T^{-1})=\big(\mathcal{M}(T)\big)^{-1}$。(由 $\mathcal{M}(T^{-1})\mathcal{M}(T)=\mathcal{M}(T^{-1}T)=\mathcal{M}(I)=I$。)

常见误区:C 是谁?C⁻¹ 在哪边?
  • $C=\mathcal{M}\big(I,(u),(v)\big)$ 的列是新基 $u_k$ 用旧基 $v$ 写出的坐标——「把新基向量按旧坐标竖着排」。
  • 别死记公式,按「翻译 → 计算 → 翻译回来」的路径从右往左读:输入是 $u$ 坐标,所以最右边必须是把 $u$ 坐标翻成 $v$ 坐标的 $C$。
  • 不同的书对「基变换矩阵」的约定不同(有的书的 $P$ 相当于这里的 $C^{-1}$),对照时要看清定义。
可逆invertible存在 $S$ 使 $ST=I$、$TS=I$;⇔ 单射且满射(3.63)。逆记作 $T^{-1}$,自动线性。
同构isomorphism, isomorphic可逆线性映射;有限维空间同构 ⇔ 维数相同(3.70)。可理解为「给向量改名」。
向量的矩阵matrix of a vector$\mathcal{M}(v)$:$v$ 在给定基下的坐标列;且 $\mathcal{M}(Tv)=\mathcal{M}(T)\mathcal{M}(v)$。
可逆矩阵invertible (nonsingular) matrix存在 $B$ 使 $AB=BA=I$;$(AC)^{-1}=C^{-1}A^{-1}$。
基变换公式change-of-basis formula$\mathcal{M}(T,(u))=C^{-1}\mathcal{M}(T,(v))C$,其中 $C=\mathcal{M}(I,(u),(v))$。
本节要点
  • 可逆 ⇔ 单射 + 满射;逆唯一且自动线性。
  • 有限维、同维:单射 ⇔ 满射 ⇔ 可逆,$ST=I\Leftrightarrow TS=I$;无穷维时都可能失败(乘 $x^2$、后移)。
  • 有限维空间同构 ⇔ 维数相同;$\mathcal{L}(V,W)\cong\mathbf{F}^{m,n}$,$\dim\mathcal{L}(V,W)=(\dim V)(\dim W)$。
  • $\mathcal{M}(Tv)=\mathcal{M}(T)\mathcal{M}(v)$;$\dim\operatorname{range}T$ = $\mathcal{M}(T)$ 的列秩。
  • 换基:$A=C^{-1}BC$。挑好基能让矩阵变简单(对角化是后话)。

3E 向量空间的积与商 Products and Quotients of Vector Spaces

这一节用两种办法造出新的向量空间:把几个空间「并排」放在一起得到积(像把几条坐标轴拼成更高维的空间);把一个子空间「压成一个点」得到商(把一族平行线看成一个个点)。两者都和基本定理配合,给出干净的维数公式。

向量空间的积 Products of Vector Spaces

和往常一样,同时出现的几个向量空间都在同一个域 $\mathbf{F}$ 上。

定义向量空间的积product of vector spaces3.87

设 $V_1,\dots,V_m$ 是 $\mathbf{F}$ 上的向量空间。它们的积是 $V_1\times\dots\times V_m=\{(v_1,\dots,v_m):v_1\in V_1,\dots,v_m\in V_m\}$,加法与数乘都逐个分量进行:$(u_1,\dots,u_m)+(v_1,\dots,v_m)=(u_1+v_1,\dots,u_m+v_m)$,$\lambda(v_1,\dots,v_m)=(\lambda v_1,\dots,\lambda v_m)$。

例𝒫₅(ℝ) 与 ℝ³ 的积product of the vector spaces 𝒫₅(𝐑) and 𝐑³3.88

$\mathcal{P}_5(\mathbf{R})\times\mathbf{R}^3$ 的元素是长度为 2 的组:第一项是多项式,第二项是 $\mathbf{R}^3$ 中的向量。例如

$(5-6x+4x^2,\ (3,8,7))+(x+9x^5,\ (2,2,2))=(5-5x+4x^2+9x^5,\ (5,10,9))$,$\ 2\,(5-6x+4x^2,\ (3,8,7))=(10-12x+8x^2,\ (6,16,14))$。

定理向量空间的积是向量空间product of vector spaces is a vector space3.89

$V_1\times\dots\times V_m$ 在上述运算下是 $\mathbf{F}$ 上的向量空间;零元是 $(0,\dots,0)$,$(v_1,\dots,v_m)$ 的加法逆元是 $(-v_1,\dots,-v_m)$。

例ℝ² × ℝ³ ≠ ℝ⁵,但两者同构𝐑² × 𝐑³ ≠ 𝐑⁵ but 𝐑² × 𝐑³ is isomorphic to 𝐑⁵3.90

$\mathbf{R}^2\times\mathbf{R}^3$ 的元素 $((x_1,x_2),(x_3,x_4,x_5))$ 是「长度为 2 的组」(第一项自己是长度 2 的组,第二项是长度 3 的组),而 $\mathbf{R}^5$ 的元素是长度为 5 的组——严格说它们不是同一种对象。但 $((x_1,x_2),(x_3,x_4,x_5))\mapsto(x_1,x_2,x_3,x_4,x_5)$ 是同构,自然到可以看作「去掉内层括号的改名」。所以有人随口说 $\mathbf{R}^2\times\mathbf{R}^3=\mathbf{R}^5$:技术上不对,精神上没错。

例𝒫₂(ℝ) × ℝ² 的一组基a basis of 𝒫₂(𝐑) × 𝐑²3.91

$(1,(0,0))$、$(x,(0,0))$、$(x^2,(0,0))$、$(0,(1,0))$、$(0,(0,1))$:每个元素「只在一个槽里放一个基向量,其余槽放 0」。这 5 个向量线性无关且张成全空间,所以 $\dim\big(\mathcal{P}_2(\mathbf{R})\times\mathbf{R}^2\big)=3+2=5$。

定理积的维数 = 维数之和dimension of a product is the sum of dimensions3.92

若 $V_1,\dots,V_m$ 都有限维,则 $V_1\times\dots\times V_m$ 有限维,且 $\dim(V_1\times\dots\times V_m)=\dim V_1+\dots+\dim V_m$。

证明思路

照例 3.91 的做法:对每个 $V_k$ 的每个基向量,造一个「第 $k$ 槽放这个基向量、其余槽放 0」的元素。它们合起来线性无关且张成积空间,个数是 $\dim V_1+\dots+\dim V_m$。

积空间给了我们一个判断「和是不是直和」的新角度。回忆第 1 章:子空间的和 $V_1+\dots+V_m$ 是直和,意思是其中每个向量只有一种写成 $v_1+\dots+v_m$($v_k\in V_k$)的方式。

定理积与直和products and direct sums3.93

设 $V_1,\dots,V_m$ 是 $V$ 的子空间,定义线性映射 $\Gamma:V_1\times\dots\times V_m\to V_1+\dots+V_m$,$\Gamma(v_1,\dots,v_m)=v_1+\dots+v_m$。则 $V_1+\dots+V_m$ 是直和当且仅当 $\Gamma$ 是单射。($\Gamma$ 按和的定义本来就是满射,所以「单射」也可以换成「可逆」。)

证明思路

由 3.15,$\Gamma$ 单射 ⇔ 把 0 写成 $v_1+\dots+v_m$ 只有全取 0 这一种方式,而这正是直和的判别条件 1.45。

定理和是直和 ⇔ 维数相加a sum is a direct sum if and only if dimensions add up3.94

设 $V$ 有限维,$V_1,\dots,V_m$ 是 $V$ 的子空间。则 $V_1+\dots+V_m$ 是直和当且仅当

$$\dim(V_1+\dots+V_m)=\dim V_1+\dots+\dim V_m.$$
证明思路

$\Gamma$ 是满射。由基本定理,$\Gamma$ 单射 ⇔ $\dim\operatorname{null}\Gamma=0$ ⇔ $\dim(V_1+\dots+V_m)=\dim(V_1\times\dots\times V_m)$,再用 3.92 把右边换成 $\sum\dim V_k$,用 3.93 把左边的条件换成「直和」。($m=2$ 时也可以由 1.46 和 2.43 得到。)

直觉:Γ 的零空间 = 「重复计算」的部分

$\dim\operatorname{null}\Gamma=\sum\dim V_k-\dim\big(\sum V_k\big)$ 恰好衡量「各部分加起来比整体多出多少维」。例:$\mathbf{R}^3$ 中的 $xy$ 平面与 $yz$ 平面,和是整个 $\mathbf{R}^3$(3 维),但 $2+2=4$,多出 1 维;$\operatorname{null}\Gamma=\{(v,-v):v\text{ 在 }y\text{ 轴上}\}$,正是两个平面共有的 $y$ 轴带来的重复——所以这不是直和。

商空间 Quotient Spaces

先定义「向量加上一个子集」。

记号v + Unotation: v + U3.95

设 $v\in V$,$U\subseteq V$。$v+U=\{v+u:u\in U\}$——把整个 $U$ 沿 $v$ 平移。

例向量加上 ℝ² 的一维子空间sum of a vector and a one-dimensional subspace of 𝐑²3.96

设 $U=\{(x,2x)\in\mathbf{R}^2:x\in\mathbf{R}\}$:过原点、斜率为 2 的直线。那么 $(17,20)+U$ 是过点 $(17,20)$、斜率为 2 的直线。

因为 $(10,20)\in U$,而 $(17,20)\in(17,20)+U$,所以 $(17,20)+U$ 就是把 $U$ 向右平移 7 个单位得到的——它与 $U$ 平行。

10 17 20 (10, 20) (17, 20) +7 U (17, 20) + U
对应原书 3.96 的图:$(17,20)+U$ 平行于子空间 $U$。
定义平移translate3.97

对 $v\in V$ 和子集 $U\subseteq V$,称 $v+U$ 是 $U$ 的一个平移。(本书第 3 版把子空间的平移叫作「仿射子集」(affine subset),其他教材也常用这个名字。)

例平移translates3.98
  • $U$ 是 $\mathbf{R}^2$ 中斜率为 2 的过原点直线时,所有斜率为 2 的直线都是 $U$ 的平移;更一般地,$\mathbf{R}^2$ 中一条过原点直线的全体平移 = 与它平行的全体直线。
  • $U$ 是 $\mathbf{R}^3$ 的 $xy$ 平面时,它的平移是所有平行于 $xy$ 平面的平面;更一般地,$\mathbf{R}^3$ 中过原点平面的全体平移 = 与它平行的全体平面(参见习题 3E.7)。
定义商空间 V/Uquotient space3.99

设 $U$ 是 $V$ 的子空间。商空间 $V/U$ 是 $U$ 的全体平移组成的集合:$V/U=\{v+U:v\in V\}$。

例商空间quotient spaces3.100
  • $U=\{(x,2x):x\in\mathbf{R}\}$ 时,$\mathbf{R}^2/U$ 是 $\mathbf{R}^2$ 中所有斜率为 2 的直线组成的集合。
  • $U$ 是 $\mathbf{R}^3$ 中过原点的直线时,$\mathbf{R}^3/U$ 是所有与 $U$ 平行的直线组成的集合。
  • $U$ 是 $\mathbf{R}^3$ 中过原点的平面时,$\mathbf{R}^3/U$ 是所有与 $U$ 平行的平面组成的集合。
直觉:商空间 = 「眯起眼睛,忽略 U 方向的差别」

在 $V/U$ 里,一整条(一整片)平移 $v+U$ 被当作一个「点」。两个向量只要相差一个 $U$ 中的向量,就被视为同一个元素——就像地图上只关心「海拔」而不关心「沿等高线走了多远」。于是 $\mathbf{R}^2/U$ 里的「点」是一条条平行线,而这些平行线自己排成了一条「直线」(1 维)。

定理子空间的两个平移要么相等,要么不相交two translates of a subspace are equal or disjoint3.101

设 $U$ 是 $V$ 的子空间,$v,w\in V$。则

$$v-w\in U\iff v+U=w+U\iff (v+U)\cap(w+U)\ne\varnothing.$$
证明思路

若 $v-w\in U$,则 $v+u=w+\big((v-w)+u\big)\in w+U$,故 $v+U\subseteq w+U$,对称地得相等。相等显然推出相交非空。若相交非空,有 $v+u_1=w+u_2$,则 $v-w=u_2-u_1\in U$。

定义V/U 上的加法与数乘addition and scalar multiplication on V/U3.102

$(v+U)+(w+U)=(v+w)+U$,$\lambda(v+U)=(\lambda v)+U$。

定理商空间是向量空间quotient space is a vector space3.103

在上述运算下,$V/U$ 是向量空间;零元是 $0+U=U$ 本身,$v+U$ 的加法逆元是 $(-v)+U$。

证明思路(关键:运算与代表元的选取无关)

难点在于同一个平移有许多种写法:$v_1+U=v_2+U$ 时 $v_1\ne v_2$ 完全可能。所以必须验证定义「说得通」(well-defined)。设 $v_1+U=v_2+U$、$w_1+U=w_2+U$,由 3.101,$v_1-v_2\in U$、$w_1-w_2\in U$;子空间对加法封闭,所以 $(v_1+w_1)-(v_2+w_2)\in U$,再用 3.101 得 $(v_1+w_1)+U=(v_2+w_2)+U$。数乘同理:$\lambda v_1-\lambda v_2=\lambda(v_1-v_2)\in U$。其余向量空间公理照搬 $V$ 的即可。

商空间 ℝ²/U:一族平行线自己组成一条「直线」

紫色粗线是子空间 $U$(拖动紫色小方块改变它的方向),淡紫色细线是它的其他平移。拖动蓝点 $v$、红点 $w$:蓝线、红线是 $v+U$、$w+U$,绿线是它们的和 $(v+w)+U$,橙色虚线是 $\lambda(v+U)$。滑块「换代表元」把 $v$ 沿 $v+U$ 滑成 $v'$(空心圈):$v'+w$ 始终落在同一条绿线上。

每条平行线都与青色虚线(垂直于 $U$ 的一条直线)恰好交于一点,这个交点的「刻度」$t$ 就可以当作这条线在 $V/U$ 中的坐标:读数里 $t$ 满足 $t\big((v+U)+(w+U)\big)=t(v+U)+t(w+U)$、$t\big(\lambda(v+U)\big)=\lambda\,t(v+U)$——$\mathbf{R}^2/U$ 就像一条 1 维的数轴,$\dim\mathbf{R}^2/U=2-1=1$。把红点拖到蓝线上,读数会告诉你 $v-w\in U$,两个平移是同一个元素(3.101)。

定义商映射 πquotient map3.104

设 $U$ 是 $V$ 的子空间。商映射 $\pi:V\to V/U$ 定义为 $\pi(v)=v+U$——把每个向量送到它所在的那条「平行线」。它是线性映射。

定理商空间的维数dimension of quotient space3.105

设 $V$ 有限维,$U$ 是 $V$ 的子空间。则

$$\dim V/U=\dim V-\dim U.$$
证明思路

对商映射 $\pi$ 用基本定理。由 3.101,$v+U=0+U$ ⇔ $v\in U$,所以 $\operatorname{null}\pi=U$;显然 $\operatorname{range}\pi=V/U$。于是 $\dim V=\dim U+\dim V/U$。

每个线性映射 $T$ 都「诱导」出商空间上的一个映射,它把 $T$ 的「不单射」修好了。

记号T̃notation: T̃3.106

设 $T\in\mathcal{L}(V,W)$。定义 $\tilde T:V/(\operatorname{null}T)\to W$,$\tilde T(v+\operatorname{null}T)=Tv$。

说得通吗?若 $u+\operatorname{null}T=v+\operatorname{null}T$,则 $u-v\in\operatorname{null}T$,于是 $Tu=Tv$——同一个平移的不同代表元给出同一个值。$\tilde T$ 的线性留给读者验证。

定理T̃ 的零空间与值域null space and range of T̃3.107

设 $T\in\mathcal{L}(V,W)$。则

(a) $\tilde T\circ\pi=T$,其中 $\pi$ 是 $V$ 到 $V/(\operatorname{null}T)$ 的商映射;(b) $\tilde T$ 是单射;(c) $\operatorname{range}\tilde T=\operatorname{range}T$;(d) $V/(\operatorname{null}T)$ 与 $\operatorname{range}T$ 同构。

证明思路

(a) $(\tilde T\circ\pi)(v)=\tilde T(v+\operatorname{null}T)=Tv$。(b) 若 $\tilde T(v+\operatorname{null}T)=0$,则 $Tv=0$,$v\in\operatorname{null}T$,由 3.101 知 $v+\operatorname{null}T=0+\operatorname{null}T$,即零空间只有零元。(c) 由定义。(d) 由 (b)(c),把 $\tilde T$ 看成映到 $\operatorname{range}T$ 的映射,它既单又满,是同构。

V range T ⊆ W V / null T T(可能不单射) π:v ↦ v + null T(把每条平行线压成一点) T̃:同构! T = T̃ ∘ π:先把 T 撞在一起的点「捏成一个」,剩下的部分就是单射
3.107 的图示(代数里叫「第一同构定理」):$V/(\operatorname{null}T)\cong\operatorname{range}T$。两边取维数,正是基本定理 $\dim V-\dim\operatorname{null}T=\dim\operatorname{range}T$。
直觉:回到 3B 的零空间演示

在 3B 的「零空间与值域」演示里,秩 1 的映射把每条与零空间平行的直线整条压到值域上的一个点。这些平行线正是 $V/(\operatorname{null}T)$ 的元素!$\tilde T$ 把「一整条线」送到「一个点」,不同的线送到不同的点——所以它是单射。

$U$ 是 $\mathbf{R}^3$ 中过原点的一个平面。关于 $\mathbf{R}^3/U$,下列哪个说法正确?

积空间product of vector spaces$V_1\times\dots\times V_m$:逐分量运算的组;维数是各维数之和。
平移(仿射子集)translate (affine subset)$v+U=\{v+u:u\in U\}$;子空间的两个平移要么相等要么不交。
商空间quotient space$V/U=\{v+U:v\in V\}$,元素是 $U$ 的平移;$\dim V/U=\dim V-\dim U$。
商映射quotient map$\pi(v)=v+U$;线性、满射,$\operatorname{null}\pi=U$。
诱导映射 T̃induced map T̃$\tilde T(v+\operatorname{null}T)=Tv$;单射,且 $V/(\operatorname{null}T)\cong\operatorname{range}T$。
本节要点
  • 积空间逐分量运算,$\dim$ 相加;$V_1+\dots+V_m$ 是直和 ⇔ $\Gamma$ 单射 ⇔ 维数相加。
  • 商空间的元素是子空间的平移(一族平行线/面);运算用代表元定义,且与代表元选取无关。
  • $\dim V/U=\dim V-\dim U$;$V/(\operatorname{null}T)\cong\operatorname{range}T$,这是基本定理的「结构版」。

3F 对偶 Duality

「吃进一个向量、吐出一个数」的线性映射在线性代数里地位特殊,值得单独命名。这一节先认识线性泛函和由它们组成的对偶空间 $V'$、对偶基;再看每个 $T$ 如何反方向诱导出对偶映射 $T'$;然后用零化子描述 $T'$ 的零空间与值域;最后发现 $T'$ 的矩阵正是 $T$ 的矩阵的转置——并由此第二次证明「列秩 = 行秩」。

对偶空间与对偶映射 Dual Space and Dual Map

定义线性泛函linear functional3.108

$V$ 上的线性泛函是从 $V$ 到 $\mathbf{F}$ 的线性映射,即 $\mathcal{L}(V,\mathbf{F})$ 的元素。

例线性泛函linear functionals3.109
  • $\varphi:\mathbf{R}^3\to\mathbf{R}$,$\varphi(x,y,z)=4x-5y+2z$。
  • 固定 $(c_1,\dots,c_n)\in\mathbf{F}^n$,$\varphi(x_1,\dots,x_n)=c_1x_1+\dots+c_nx_n$。
  • $\varphi:\mathcal{P}(\mathbf{R})\to\mathbf{R}$,$\varphi(p)=3p''(5)+7p(4)$。
  • $\varphi:\mathcal{P}(\mathbf{R})\to\mathbf{R}$,$\varphi(p)=\int_0^1p$。
直觉:线性泛函 = 一族等间距的「等高线」

在 $\mathbf{R}^2$ 上,非零泛函 $\varphi(x,y)=ax+by$ 最好的画法不是箭头,而是它的等值线 $\varphi=0,\pm1,\pm2,\dots$:一族平行、等间距的直线(就像倾斜平面的等高线地图)。$\varphi(v)$ 就是「$v$ 站在第几条线上」。$\varphi=0$ 那条线就是 $\operatorname{null}\varphi$;线越密,$\varphi$ 变化越快。

定义对偶空间 V′dual space3.110

$V$ 的对偶空间 $V'$ 是 $V$ 上全体线性泛函组成的向量空间:$V'=\mathcal{L}(V,\mathbf{F})$。

定理dim V′ = dim Vdim V′ = dim V3.111

若 $V$ 有限维,则 $V'$ 也有限维,且 $\dim V'=\dim V$。(由 3.72:$\dim\mathcal{L}(V,\mathbf{F})=(\dim V)(\dim\mathbf{F})=\dim V$。)

定义对偶基dual basis3.112

设 $v_1,\dots,v_n$ 是 $V$ 的基。它的对偶基是 $V'$ 中的 $\varphi_1,\dots,\varphi_n$,其中每个 $\varphi_j$ 是满足下式的线性泛函(由线性映射引理 3.4,它存在且唯一):

$$\varphi_j(v_k)=\begin{cases}1, & k=j,\\ 0, & k\ne j.\end{cases}$$
例𝐅ⁿ 标准基的对偶基the dual basis of the standard basis of 𝐅ⁿ3.113

令 $\varphi_j(x_1,\dots,x_n)=x_j$(取第 $j$ 个坐标)。则 $\varphi_j(e_k)$ 在 $k=j$ 时为 1、否则为 0,所以 $\varphi_1,\dots,\varphi_n$ 是标准基 $e_1,\dots,e_n$ 的对偶基——坐标函数就是对偶基。

定理对偶基给出线性组合的系数dual basis gives coefficients for linear combination3.114

设 $v_1,\dots,v_n$ 是 $V$ 的基,$\varphi_1,\dots,\varphi_n$ 是对偶基。则对每个 $v\in V$,

$$v=\varphi_1(v)\,v_1+\dots+\varphi_n(v)\,v_n.$$
证明思路

写 $v=c_1v_1+\dots+c_nv_n$ 3.115,两边作用 $\varphi_j$:右边只剩 $c_j\varphi_j(v_j)=c_j$。所以 $c_j=\varphi_j(v)$。

定理对偶基是对偶空间的基dual basis is a basis of the dual space3.116

若 $V$ 有限维,则 $V$ 的一组基的对偶基是 $V'$ 的基。

证明思路

若 $a_1\varphi_1+\dots+a_n\varphi_n=0$ 3.117,把它作用在 $v_k$ 上得 $a_k=0$,所以线性无关;个数 $n=\dim V'$,由 2.38 是基。

对偶基:φ₁、φ₂ 是两族「等高线」,读出来的就是坐标

拖动基向量 $v_1$(蓝)、$v_2$(红)。蓝色平行线是 $\varphi_1$ 的等值线 $\varphi_1=k$,红色平行线是 $\varphi_2=k$($k$ 为整数,数值标在线端)。拖动绿点 $x$:它落在哪条蓝线、哪条红线上,读出的 $\varphi_1(x)$、$\varphi_2(x)$ 就是 $x$ 在基 $v_1,v_2$ 下的坐标。

蓝线($\varphi_1$ 的等值线)总是平行于 $v_2$——因为 $\varphi_1(v_2)=0$,$v_2$ 方向上 $\varphi_1$ 不变;而 $\varphi_1=1$ 那条线穿过 $v_1$ 的尖端。试着只拖动 $v_2$:蓝线也跟着转了!对偶基的每个成员都依赖于整组基,而不只依赖于「对应的那一个」向量。点「标准基」:等值线变成竖线和横线,$\varphi_1$、$\varphi_2$ 就是取第 1、2 个坐标(例 3.113)。

常见误区
  • 「$\varphi_1$ 只由 $v_1$ 决定」——错。改变 $v_2$ 会改变 $\varphi_1$(上面的演示)。在 $\mathbf{R}^n$ 中,对偶基的 $\varphi_j$ 恰是矩阵 $\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}^{-1}$ 的第 $j$ 行。
  • 「$\varphi_j$ 就是 $v_j$ 方向上的投影长度」——一般不对。那是有内积、且基规范正交时的特例(第 6 章);对偶空间的定义里根本没有「长度」「角度」。

每个线性映射 $T:V\to W$ 都会反方向诱导出对偶空间之间的一个映射。

定义对偶映射 T′dual map3.118

设 $T\in\mathcal{L}(V,W)$。$T$ 的对偶映射是 $T'\in\mathcal{L}(W',V')$,对每个 $\varphi\in W'$ 定义为

$$T'(\varphi)=\varphi\circ T.$$

$\varphi\circ T$ 是 $V\to W\to\mathbf{F}$ 的复合,确实是 $V$ 上的线性泛函。$T'$ 本身是线性的:$T'(\varphi+\psi)=(\varphi+\psi)\circ T=\varphi\circ T+\psi\circ T$,$T'(\lambda\varphi)=\lambda(\varphi\circ T)$。

V W F T φ ∈ W′ T′(φ) = φ ∘ T ∈ V′(先 T,再 φ)
$T$ 从 $V$ 走向 $W$,$T'$ 却从 $W'$ 走回 $V'$:给 $W$ 上的一个「测量仪」$\varphi$,$T'$ 造出 $V$ 上的测量仪——「先用 $T$ 搬过去,再用 $\varphi$ 测」。
例微分映射的对偶映射dual map of the differentiation linear map3.119

$D:\mathcal{P}(\mathbf{R})\to\mathcal{P}(\mathbf{R})$,$Dp=p'$。(注意:$D'$ 是对偶映射,$p'$ 是导数——撇号有两个无关的含义。)

  • 若 $\varphi(p)=p(3)$,则 $(D'(\varphi))(p)=\varphi(Dp)=\varphi(p')=p'(3)$:$D'(\varphi)$ 是「在 3 处求导数值」。
  • 若 $\varphi(p)=\int_0^1p$,则 $(D'(\varphi))(p)=\int_0^1p'=p(1)-p(0)$。
定理对偶映射的代数性质algebraic properties of dual maps3.120

设 $T\in\mathcal{L}(V,W)$。则 (a) $(S+T)'=S'+T'$($S\in\mathcal{L}(V,W)$);(b) $(\lambda T)'=\lambda T'$;(c) $(ST)'=T'S'$($S\in\mathcal{L}(W,U)$)——顺序反过来了。

证明 (c)

对 $\varphi\in U'$:$(ST)'(\varphi)=\varphi\circ(ST)=(\varphi\circ S)\circ T=T'(\varphi\circ S)=T'(S'(\varphi))=(T'S')(\varphi)$。直观地说:$ST$ 是「先 $T$ 后 $S$」,拉回泛函时要「先过 $S$ 再过 $T$」。

有的书用 $V^*$、$T^*$ 表示对偶;Axler 把 $T^*$ 留给第 7 章内积空间里的伴随(adjoint),所以这里用撇号。

对偶映射的零空间与值域 Null Space and Range of Dual of Linear Map

目标:用 $T$ 的值域和零空间来描述 $T'$ 的零空间和值域。需要一个新概念。

定义零化子 U⁰annihilator3.121

对 $U\subseteq V$,$U$ 的零化子是 $U^0=\{\varphi\in V':\varphi(u)=0\ \text{对所有}\ u\in U\}$——所有「把 $U$ 整个压成 0」的泛函。它是 $V'$ 的子集(严格说依赖于包含 $U$ 的空间 $V$)。

例零化子中的元素element of an annihilator3.122

$U$ = $\mathcal{P}(\mathbf{R})$ 中 $x^2$ 的多项式倍数全体。$\varphi(p)=p'(0)$ 属于 $U^0$:$(x^2q)'(0)=\big(2xq+x^2q'\big)(0)=0$。

例ℝ⁵ 的二维子空间的零化子the annihilator of a two-dimensional subspace of 𝐑⁵3.123

$U=\operatorname{span}(e_1,e_2)$,$\varphi_1,\dots,\varphi_5$ 是标准基的对偶基。则 $U^0=\operatorname{span}(\varphi_3,\varphi_4,\varphi_5)$:泛函 $\sum c_j\varphi_j$ 在 $U$ 上恒为 0 ⇔ $c_1=\varphi(e_1)=0$ 且 $c_2=0$。

定理零化子是子空间the annihilator is a subspace3.124

若 $U\subseteq V$,则 $U^0$ 是 $V'$ 的子空间。(零泛函在其中;两个在 $U$ 上为 0 的泛函之和、数乘仍在 $U$ 上为 0。)

定理零化子的维数dimension of the annihilator3.125

设 $V$ 有限维,$U$ 是 $V$ 的子空间。则

$$\dim U^0=\dim V-\dim U.$$
证明思路(两种)

朴素法(Axler 建议你自己写出来):取 $U$ 的基 $u_1,\dots,u_m$,扩充为 $V$ 的基 $u_1,\dots,u_n$,取对偶基 $\varphi_1,\dots,\varphi_n$,照例 3.123 的方法证明 $\varphi_{m+1},\dots,\varphi_n$ 是 $U^0$ 的基。

书中的简洁证法:设 $i\in\mathcal{L}(U,V)$ 是包含映射 $i(u)=u$,则 $i'\in\mathcal{L}(V',U')$ 把 $V$ 上的泛函「限制」到 $U$ 上。对 $i'$ 用基本定理:$\dim\operatorname{range}i'+\dim\operatorname{null}i'=\dim V'$。显然 $\operatorname{null}i'=U^0$;又 $U$ 上的每个泛函都能延拓到 $V$ 上(习题 3A.13),所以 $\operatorname{range}i'=U'$,维数是 $\dim U$。代入 3.126 即得。

定理零化子为 {0} 或整个空间的条件condition for the annihilator to equal {0} or the whole space3.127

设 $V$ 有限维,$U$ 是子空间。则 (a) $U^0=\{0\}\iff U=V$;(b) $U^0=V'\iff U=\{0\}$。(都由维数公式 3.125 直接得出:子空间越大,能把它整个压成 0 的泛函越少。)

定理T′ 的零空间the null space of T′3.128

设 $V,W$ 有限维,$T\in\mathcal{L}(V,W)$。则 (a) $\operatorname{null}T'=(\operatorname{range}T)^0$;(b) $\dim\operatorname{null}T'=\dim\operatorname{null}T+\dim W-\dim V$。

证明思路

(a) $T'(\varphi)=\varphi\circ T=0$ ⇔ 对所有 $v$,$\varphi(Tv)=0$ ⇔ $\varphi$ 在 $\operatorname{range}T$ 上恒为 0。(这一步不需要有限维。)(b) $\dim(\operatorname{range}T)^0=\dim W-\dim\operatorname{range}T=\dim W-(\dim V-\dim\operatorname{null}T)$,先用 3.125,再用基本定理。

定理T 满射 ⇔ T′ 单射T surjective is equivalent to T′ injective3.129

设 $V,W$ 有限维,$T\in\mathcal{L}(V,W)$。则 $T$ 是满射 $\iff$ $T'$ 是单射。($\operatorname{range}T=W$ ⇔ $(\operatorname{range}T)^0=\{0\}$ ⇔ $\operatorname{null}T'=\{0\}$。有时证明 $T'$ 单射比直接证明 $T$ 满射更容易。)

定理T′ 的值域the range of T′3.130

设 $V,W$ 有限维,$T\in\mathcal{L}(V,W)$。则 (a) $\dim\operatorname{range}T'=\dim\operatorname{range}T$;(b) $\operatorname{range}T'=(\operatorname{null}T)^0$。

证明思路

(a) $\dim\operatorname{range}T'=\dim W'-\dim\operatorname{null}T'=\dim W-\dim(\operatorname{range}T)^0=\dim\operatorname{range}T$。(b) 若 $\varphi=T'(\psi)=\psi\circ T$,则 $\varphi$ 在 $\operatorname{null}T$ 上为 0,所以 $\operatorname{range}T'\subseteq(\operatorname{null}T)^0$;两边维数都是 $\dim V-\dim\operatorname{null}T$,所以相等。

定理T 单射 ⇔ T′ 满射T injective is equivalent to T′ surjective3.131

设 $V,W$ 有限维,$T\in\mathcal{L}(V,W)$。则 $T$ 是单射 $\iff$ $T'$ 是满射。($\operatorname{null}T=\{0\}$ ⇔ $(\operatorname{null}T)^0=V'$ ⇔ $\operatorname{range}T'=V'$。)

关于 $T\in\mathcal{L}(V,W)$对应的关于 $T'\in\mathcal{L}(W',V')$原书
$\operatorname{range}T$$\operatorname{null}T'=(\operatorname{range}T)^0$3.128
$\operatorname{null}T$$\operatorname{range}T'=(\operatorname{null}T)^0$3.130
$\dim\operatorname{range}T$$\dim\operatorname{range}T'$(相等)3.130
满射单射3.129
单射满射3.131
$\mathcal{M}(T)$$\mathcal{M}(T')=\mathcal{M}(T)^{\mathrm t}$(对偶基下)3.132
对偶映射 T′ψ = ψ∘T:把 W 上的等值线「拉回」到 V

右图是 $W$:紫色平行线是泛函 $\psi$ 的等值线($\psi=1$ 加粗),拖动紫色方块(它是 $\psi=1$ 那条线上离原点最近的点)来改变 $\psi$。左图是 $V$:紫色线是 $T'(\psi)=\psi\circ T$ 的等值线——正是右边等值线在 $T$ 下的原像。拖动绿点 $v$:左边读到的 $(T'\psi)(v)$ 与右边读到的 $\psi(Tv)$ 永远相等。

用坐标看:$\psi$ 是行向量 $[p\ \ q]$,$T'\psi=\psi\circ T$ 就是行向量 $[p\ \ q]\,\mathcal{M}(T)$——右乘矩阵;把行写成列,就是 $\mathcal{M}(T)^{\mathrm t}$ 左乘列向量,这正是下面的 3.132。选「秩 1」再点「取 $\psi\in(\operatorname{range}T)^0$」:$\psi$ 的等值线与值域平行,拉回后在 $V$ 上处处为 0——$T'\psi=0$,所以 $\operatorname{null}T'=(\operatorname{range}T)^0\ne\{0\}$,$T'$ 不是单射,对应 $T$ 不是满射(3.129)。

对偶映射的矩阵 Matrix of Dual of Linear Map

设 $v_1,\dots,v_n$ 是 $V$ 的基、$\varphi_1,\dots,\varphi_n$ 是其对偶基;$w_1,\dots,w_m$ 是 $W$ 的基、$\psi_1,\dots,\psi_m$ 是其对偶基。$\mathcal{M}(T)$ 相对于 $V$、$W$ 的基,$\mathcal{M}(T')$ 相对于 $W'$、$V'$ 的对偶基。于是有一个漂亮的结果:

定理T′ 的矩阵是 T 的矩阵的转置matrix of T′ is transpose of matrix of T3.132
$$\mathcal{M}(T')=\big(\mathcal{M}(T)\big)^{\mathrm t}.$$
证明思路

记 $A=\mathcal{M}(T)$,$C=\mathcal{M}(T')$。按定义 $T'(\psi_j)=\sum_rC_{r,j}\varphi_r$;两边作用在 $v_k$ 上,左边是 $(\psi_j\circ T)(v_k)$,右边是 $C_{k,j}$。另一方面 $(\psi_j\circ T)(v_k)=\psi_j\big(\sum_rA_{r,k}w_r\big)=A_{j,k}$。所以 $C_{k,j}=A_{j,k}$,即 $C=A^{\mathrm t}$。

定理列秩 = 行秩(对偶的证法)column rank equals row rank3.133

对 $A\in\mathbf{F}^{m,n}$,列秩 = 行秩。

证明思路

令 $T:\mathbf{F}^{n,1}\to\mathbf{F}^{m,1}$,$Tx=Ax$,则关于标准基 $\mathcal{M}(T)=A$。于是 $A$ 的列秩 $=\dim\operatorname{range}T$(3.78)$=\dim\operatorname{range}T'$(3.130(a))$=\mathcal{M}(T')$ 的列秩(3.78)$=A^{\mathrm t}$ 的列秩(3.132)$=A$ 的行秩。

两种证法对比

3.57 用列–行分解,纯粹在矩阵里计算;3.133 把问题翻译成「$T$ 与 $T'$ 的值域一样大」,再利用「对偶映射的矩阵是转置」。后者体现了 Axler 的风格:把矩阵的事实还原成线性映射的事实,证明往往更短、更有解释力。

$\mathbf{R}^2$ 的基 $v_1=(1,0)$,$v_2=(1,1)$。它的对偶基中的 $\varphi_1$ 是?

$T\in\mathcal{L}(\mathbf{R}^5,\mathbf{R}^3)$ 是满射。关于 $T'\in\mathcal{L}\big((\mathbf{R}^3)',(\mathbf{R}^5)'\big)$,可以断定?

线性泛函linear functional$V\to\mathbf{F}$ 的线性映射;在 $\mathbf{R}^2$ 中可画成一族平行等距的等值线。
对偶空间dual space$V'=\mathcal{L}(V,\mathbf{F})$;有限维时 $\dim V'=\dim V$。
对偶基dual basis$\varphi_j(v_k)=\delta_{jk}$;$\varphi_j(v)$ 就是 $v$ 的第 $j$ 个坐标。
对偶映射dual map$T'(\varphi)=\varphi\circ T$,方向相反:$W'\to V'$;$(ST)'=T'S'$。
零化子annihilator$U^0=\{\varphi\in V':\varphi|_U=0\}$;$\dim U^0=\dim V-\dim U$。
二重对偶double dual$V''=(V')'$;$(\Lambda v)(\varphi)=\varphi(v)$ 给出不依赖基的同构 $V\cong V''$(有限维,习题 3F.32)。
本节要点
  • 线性泛函 = 「测量仪」;对偶基的第 $j$ 个成员读出第 $j$ 个坐标,但它依赖整组基。
  • 对偶映射 $T'\varphi=\varphi\circ T$ 反向工作:$(ST)'=T'S'$。
  • $\operatorname{null}T'=(\operatorname{range}T)^0$,$\operatorname{range}T'=(\operatorname{null}T)^0$,$\dim U^0=\dim V-\dim U$;单射与满射在对偶下互换。
  • $\mathcal{M}(T')=\mathcal{M}(T)^{\mathrm t}$,由此再证列秩 = 行秩。

本章小结

  • 线性映射 = 保持加法与数乘的函数(3.1),一定把 0 送到 0(3.10);它由基上的值唯一决定,而基上的值可以任意指定(线性映射引理 3.4)。全体线性映射 $\mathcal{L}(V,W)$ 是向量空间,还能复合(相乘),不满足交换律(3.9)。
  • 零空间与值域都是子空间(3.13、3.18);单射 ⇔ $\operatorname{null}T=\{0\}$(3.15)。基本定理:$\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$(3.21)。推论:往低维空间映射不能单射(3.22),往高维空间映射不能满射(3.24);未知数多于方程的齐次方程组有非零解(3.26),方程多于未知数的方程组对某些常数项无解(3.28)。
  • 矩阵 $\mathcal{M}(T)$ 的第 $k$ 列是 $Tv_k$ 的坐标(3.31);矩阵的加法、数乘、乘法都照着线性映射的运算来定义,$\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$(3.43)。$Ab$ 是 $A$ 各列的组合(3.50);列–行分解 $A=CR$(3.56)给出列秩 = 行秩(3.57)。
  • 可逆 ⇔ 单射 + 满射(3.63);有限维且同维时单射 ⇔ 满射 ⇔ 可逆(3.65),$ST=I\Leftrightarrow TS=I$(3.68);无穷维时不成立(3.64)。有限维空间同构 ⇔ 维数相同(3.70);$\mathcal{L}(V,W)\cong\mathbf{F}^{m,n}$(3.71),$\dim\mathcal{L}(V,W)=(\dim V)(\dim W)$(3.72)。
  • 坐标化:$\mathcal{M}(Tv)=\mathcal{M}(T)\mathcal{M}(v)$(3.76),$\dim\operatorname{range}T=\mathcal{M}(T)$ 的列秩(3.78)。基变换:$A=C^{-1}BC$(3.84);挑选好的基可以让矩阵变简单。
  • 积与商:$\dim(V_1\times\dots\times V_m)=\sum\dim V_k$(3.92);和是直和 ⇔ 维数相加(3.94)。$V/U$ 的元素是平移 $v+U$(3.99),$\dim V/U=\dim V-\dim U$(3.105),$V/(\operatorname{null}T)\cong\operatorname{range}T$(3.107)。
  • 对偶:$\dim V'=\dim V$(3.111);对偶基读出坐标(3.114);$T'\varphi=\varphi\circ T$(3.118),$(ST)'=T'S'$(3.120);$\dim U^0=\dim V-\dim U$(3.125);$\operatorname{null}T'=(\operatorname{range}T)^0$、$\operatorname{range}T'=(\operatorname{null}T)^0$(3.128、3.130);$T$ 满射 ⇔ $T'$ 单射,$T$ 单射 ⇔ $T'$ 满射(3.129、3.131);$\mathcal{M}(T')=\mathcal{M}(T)^{\mathrm t}$(3.132)。
对象住在哪里维数一句话直觉
$\operatorname{null}T$$V$ 的子空间$\dim V-\dim\operatorname{range}T$被压成 0 的方向
$\operatorname{range}T$$W$ 的子空间$\mathcal{M}(T)$ 的秩$T$ 能到达的地方
$\mathcal{L}(V,W)$新的向量空间$(\dim V)(\dim W)$一个映射 = 一张 $m\times n$ 数表
$V_1\times\dots\times V_m$新的向量空间$\sum\dim V_k$把几个空间并排放
$V/U$新的向量空间$\dim V-\dim U$一族平行线/面,每条算一个点
$V'$新的向量空间$\dim V$$V$ 上的「测量仪」(等高线)
$U^0$$V'$ 的子空间$\dim V-\dim U$把 $U$ 整个测成 0 的泛函
$T'$$\mathcal{L}(W',V')$$\dim\operatorname{range}T'=\dim\operatorname{range}T$反向「拉回」测量仪;矩阵是转置

概念之间的联系:线性映射引理(3.4)→ 矩阵(3.31)→ $\mathcal{L}(V,W)\cong\mathbf{F}^{m,n}$(3.71)→ 坐标化 $\mathcal{M}(Tv)=\mathcal{M}(T)\mathcal{M}(v)$(3.76)→ 基变换(3.84)。另一条主线是基本定理(3.21):它推出方程组的两个结论、同维时单射 ⇔ 满射(3.65)、同构 ⇔ 维数相同(3.70)、直和的维数判别(3.94)、商空间的维数(3.105)与零化子的维数(3.125),并通过 $T'$ 再一次给出列秩 = 行秩(3.133)。下一章(多项式)之后,第 5 章将用本章的工具研究算子的特征值与不变子空间——那时「挑一组让矩阵最简单的基」会成为主角。

自测

前面各节已穿插了 10 道小题,这里再来几道综合题。

$V$ 有限维,$S,T\in\mathcal{L}(V)$ 且 $ST=I$。下列哪项一定成立?

一个有 5 个方程、3 个未知数的(非齐次)线性方程组,关于常数项可以断定?

$\dim V=7$,$U$ 是 $V$ 的 3 维子空间。$\dim V/U$ 与 $\dim U^0$ 分别是?

某个 $T\in\mathcal{L}(\mathbf{R}^2)$ 关于某组基的矩阵是 $\begin{pmatrix}1 & 2\\ 2 & 4\end{pmatrix}$。换一组基之后,它的矩阵……

习题

以下选自原书各节末的习题(编号与原书一致),每节至少一题;先自己想,再看提示和参考解答。

3A.4设 $T\in\mathcal{L}(V,W)$,$v_1,\dots,v_m\in V$,且 $Tv_1,\dots,Tv_m$ 在 $W$ 中线性无关。证明 $v_1,\dots,v_m$ 线性无关。
提示设 $a_1v_1+\dots+a_mv_m=0$,两边作用 $T$。
参考解答设 $a_1v_1+\dots+a_mv_m=0$。作用 $T$ 并用线性:$a_1Tv_1+\dots+a_mTv_m=T(0)=0$。由于 $Tv_1,\dots,Tv_m$ 线性无关,所有 $a_k=0$。所以 $v_1,\dots,v_m$ 线性无关。(反过来不成立:线性无关的向量经过 $T$ 可能变得线性相关,例如被零映射全部压成 0。)
3A.8给出一个函数 $\varphi:\mathbf{R}^2\to\mathbf{R}$,使得对所有 $a\in\mathbf{R}$、$v\in\mathbf{R}^2$ 都有 $\varphi(av)=a\varphi(v)$,但 $\varphi$ 不是线性的。
提示找一个「一次齐次」但不是线性组合的式子,比如用立方根。
参考解答令 $\varphi(x,y)=(x^3+y^3)^{1/3}$(实立方根)。齐次性:$\varphi(ax,ay)=\big(a^3(x^3+y^3)\big)^{1/3}=a(x^3+y^3)^{1/3}=a\varphi(x,y)$,对负的 $a$ 也成立,因为实立方根满足 $\sqrt[3]{a^3s}=a\sqrt[3]{s}$。不可加:$\varphi(1,0)+\varphi(0,1)=1+1=2$,而 $\varphi(1,1)=\sqrt[3]{2}\ne2$。(3A 节「线性检验器」中的最后一个函数就是它的二维版本。)
3B.3设 $v_1,\dots,v_m\in V$,定义 $T\in\mathcal{L}(\mathbf{F}^m,V)$ 为 $T(z_1,\dots,z_m)=z_1v_1+\dots+z_mv_m$。(a) $T$ 的什么性质对应于「$v_1,\dots,v_m$ 张成 $V$」?(b) $T$ 的什么性质对应于「$v_1,\dots,v_m$ 线性无关」?
提示写出 $\operatorname{range}T$ 和 $\operatorname{null}T$。
参考解答(a) $\operatorname{range}T=\{z_1v_1+\dots+z_mv_m\}=\operatorname{span}(v_1,\dots,v_m)$,所以「$v$ 们张成 $V$」⇔ $\operatorname{range}T=V$ ⇔ $T$ 是满射。(b) $\operatorname{null}T=\{z:z_1v_1+\dots+z_mv_m=0\}$,所以「$v$ 们线性无关」⇔ 唯一的零组合是平凡的 ⇔ $\operatorname{null}T=\{0\}$ ⇔ $T$ 是单射(3.15)。于是「$v$ 们是基」⇔ $T$ 是同构——第 2 章的张成、无关、基,全都是这个映射的性质。
3B.5给出一个 $T\in\mathcal{L}(\mathbf{R}^4)$,使得 $\operatorname{range}T=\operatorname{null}T$。
提示让 $T$ 把后两个坐标「搬到」前两个位置,再把后两个坐标清零。
参考解答令 $T(x_1,x_2,x_3,x_4)=(x_3,x_4,0,0)$。值域 $=\{(a,b,0,0):a,b\in\mathbf{R}\}$;零空间 $=\{x:x_3=x_4=0\}=\{(a,b,0,0)\}$。两者相等。(注意此时 $T^2=0$。)
3B.6证明不存在 $T\in\mathcal{L}(\mathbf{R}^5)$ 使得 $\operatorname{range}T=\operatorname{null}T$。
提示数维数。
参考解答若 $\operatorname{range}T=\operatorname{null}T$,由基本定理 $5=\dim\operatorname{null}T+\dim\operatorname{range}T=2\dim\operatorname{range}T$,而 5 是奇数,矛盾。
3B.12设 $T$ 是 $\mathbf{F}^4\to\mathbf{F}^2$ 的线性映射,且 $\operatorname{null}T=\{(x_1,x_2,x_3,x_4)\in\mathbf{F}^4:x_1=5x_2\ \text{且}\ x_3=7x_4\}$。证明 $T$ 是满射。
提示先求 $\dim\operatorname{null}T$,再用基本定理。
参考解答$\operatorname{null}T=\{(5x_2,x_2,7x_4,x_4)\}=\operatorname{span}\big((5,1,0,0),(0,0,7,1)\big)$,这两个向量线性无关,所以 $\dim\operatorname{null}T=2$。由基本定理 $\dim\operatorname{range}T=4-2=2=\dim\mathbf{F}^2$,而 $\operatorname{range}T$ 是 $\mathbf{F}^2$ 的子空间,维数满了就等于全空间(2.39),所以 $T$ 是满射。
3C.4设 $D\in\mathcal{L}(\mathcal{P}_3(\mathbf{R}),\mathcal{P}_2(\mathbf{R}))$ 是微分映射。找 $\mathcal{P}_3(\mathbf{R})$ 的一组基和 $\mathcal{P}_2(\mathbf{R})$ 的一组基,使 $D$ 关于它们的矩阵是 $\begin{pmatrix}1 & 0 & 0 & 0\\ 0 & 1 & 0 & 0\\ 0 & 0 & 1 & 0\end{pmatrix}$。
提示第 $k$ 列是第 $k$ 个基向量的像的坐标:希望前三个基向量分别求导得到 $1,x,x^2$,第四个求导得 0。
参考解答$\mathcal{P}_2(\mathbf{R})$ 用 $1,x,x^2$;$\mathcal{P}_3(\mathbf{R})$ 用 $x,\ \tfrac{x^2}{2},\ \tfrac{x^3}{3},\ 1$(这四个多项式次数互不相同,是一组基)。则 $D(x)=1$,$D(\tfrac{x^2}{2})=x$,$D(\tfrac{x^3}{3})=x^2$,$D(1)=0$,逐列写下坐标正好得到所给矩阵。与例 3.33 对比:同一个映射,换了基,矩阵简单得多(习题 3C.5 把这推广到一般情形)。
3C.16设 $A$ 是非零的 $m\times n$ 矩阵。证明 $A$ 的秩为 1,当且仅当存在 $(c_1,\dots,c_m)\in\mathbf{F}^m$ 与 $(d_1,\dots,d_n)\in\mathbf{F}^n$ 使得对所有 $j,k$ 都有 $A_{j,k}=c_jd_k$。
提示「⇒」用列–行分解;「⇐」看 $A$ 的每一列。
参考解答(⇒) 秩为 1 即列秩 $c=1$,由列–行分解 3.56,$A=CR$,其中 $C$ 是 $m\times1$ 矩阵(记其元素为 $c_1,\dots,c_m$),$R$ 是 $1\times n$ 矩阵(元素 $d_1,\dots,d_n$),于是 $A_{j,k}=c_jd_k$。(⇐) 若 $A_{j,k}=c_jd_k$,则 $A$ 的第 $k$ 列是 $d_k$ 乘以列向量 $c=(c_1,\dots,c_m)^{\mathrm t}$,所以所有列都在 $\operatorname{span}(c)$ 里,列秩 $\le1$;又 $A\ne0$,列秩 $\ge1$。故秩为 1。(秩 1 矩阵 = 「一列 × 一行」,在后面的奇异值分解里是基本积木。)
3D.24设 $A,B$ 是同阶方阵且 $AB=I$。证明 $BA=I$。
提示把矩阵变成线性映射,用 3.68。
参考解答设 $A,B$ 是 $n\times n$ 的。定义 $S,T\in\mathcal{L}(\mathbf{F}^{n,1})$:$Sx=Ax$,$Tx=Bx$。则对所有 $x$,$(ST)x=A(Bx)=(AB)x=x$,即 $ST=I$。由于 $S,T$ 是同一个有限维空间上的算子,3.68 给出 $TS=I$,即对所有 $x$ 有 $B(Ax)=x$,也就是 $(BA)x=x$。取 $x=e_k$ 知 $BA$ 的第 $k$ 列是 $e_k$,所以 $BA=I$。(直接用矩阵元素证明要麻烦得多——这正是 Artin 那句话的意思:扔掉矩阵,证明能短一半。)
3E.8(a) 设 $T\in\mathcal{L}(V,W)$,$c\in W$。证明 $\{x\in V:Tx=c\}$ 要么是空集,要么是 $\operatorname{null}T$ 的一个平移。(b) 解释为什么形如 3.27 的线性方程组的解集要么是空集,要么是 $\mathbf{F}^n$ 某个子空间的平移。
提示如果有一个解 $x_0$,那么其他解与它相差什么?
参考解答(a) 若集合非空,取一个 $x_0$ 使 $Tx_0=c$。则 $Tx=c$ ⇔ $T(x-x_0)=0$ ⇔ $x-x_0\in\operatorname{null}T$ ⇔ $x\in x_0+\operatorname{null}T$。所以解集恰为 $x_0+\operatorname{null}T$。(b) 方程组 3.27 就是 $Tx=c$,其中 $T$ 由 3.25 定义、$c=(c_1,\dots,c_m)$,由 (a) 其解集是空集或 $\operatorname{null}T$($\mathbf{F}^n$ 的子空间)的平移。这就是熟悉的「通解 = 一个特解 + 齐次方程组的通解」;3B 的零空间演示里那条橙色直线正是这样一个平移。
3E.16设 $\varphi\in\mathcal{L}(V,\mathbf{F})$ 且 $\varphi\ne0$。证明 $\dim V/(\operatorname{null}\varphi)=1$。
提示用 3.107(d)。注意这里 $V$ 可以是无穷维的。
参考解答由 3.107(d),$V/(\operatorname{null}\varphi)$ 与 $\operatorname{range}\varphi$ 同构。$\operatorname{range}\varphi$ 是 $\mathbf{F}$(1 维)的子空间,且因为 $\varphi\ne0$ 而不是 $\{0\}$,所以 $\operatorname{range}\varphi=\mathbf{F}$,维数为 1。同构保持维数,故 $\dim V/(\operatorname{null}\varphi)=1$。(几何上:非零泛函的等值线恰好排成一条「数轴」——3F 演示中的平行线族。)
3F.9设 $m$ 是正整数。证明 $\mathcal{P}_m(\mathbf{R})$ 的基 $1,x,\dots,x^m$ 的对偶基是 $\varphi_0,\varphi_1,\dots,\varphi_m$,其中 $\varphi_k(p)=\dfrac{p^{(k)}(0)}{k!}$($p^{(k)}$ 是 $k$ 阶导数,$p^{(0)}=p$)。
提示验证 $\varphi_j(x^k)$ 在 $j=k$ 时为 1、否则为 0。
参考解答每个 $\varphi_k$ 显然是线性泛函(求导、代入 0、除以常数都是线性的)。若 $j\gt k$,$x^k$ 的 $j$ 阶导数为 0;若 $j\lt k$,$(x^k)^{(j)}=\tfrac{k!}{(k-j)!}x^{k-j}$,在 0 处为 0;若 $j=k$,$(x^k)^{(k)}=k!$,所以 $\varphi_k(x^k)=1$。这正是对偶基的定义 3.112。由 3.114 立即得到泰勒公式:$p=\sum_{k=0}^m\frac{p^{(k)}(0)}{k!}x^k$——对偶基「读出坐标」。
3F.14定义 $T:\mathbf{R}^3\to\mathbf{R}^2$ 为 $T(x,y,z)=(4x+5y+6z,\ 7x+8y+9z)$。设 $\varphi_1,\varphi_2$ 是 $\mathbf{R}^2$ 标准基的对偶基,$\psi_1,\psi_2,\psi_3$ 是 $\mathbf{R}^3$ 标准基的对偶基。(a) 描述线性泛函 $T'(\varphi_1)$ 与 $T'(\varphi_2)$。(b) 把它们写成 $\psi_1,\psi_2,\psi_3$ 的线性组合。
提示$\varphi_1$ 取第一个坐标,$T'(\varphi_1)=\varphi_1\circ T$。
参考解答(a) $(T'(\varphi_1))(x,y,z)=\varphi_1(T(x,y,z))=4x+5y+6z$;$(T'(\varphi_2))(x,y,z)=7x+8y+9z$。(b) 因为 $\psi_j$ 取第 $j$ 个坐标,$T'(\varphi_1)=4\psi_1+5\psi_2+6\psi_3$,$T'(\varphi_2)=7\psi_1+8\psi_2+9\psi_3$。于是 $\mathcal{M}(T')=\begin{pmatrix}4 & 7\\ 5 & 8\\ 6 & 9\end{pmatrix}$,恰是 $\mathcal{M}(T)=\begin{pmatrix}4 & 5 & 6\\ 7 & 8 & 9\end{pmatrix}$ 的转置,印证 3.132。
第 4 章

多项式 Polynomials

后面几章研究「从空间到自身的线性映射」(算子)时,最有力的工具就是多项式:特征值恰好是某个多项式的零点。这一章把要用到的多项式事实一次备齐——零点与因式、带余除法、代数基本定理,以及 ℂ 与 ℝ 上的因式分解。

学习目标
  • 把复数看成平面上的点:共轭 = 关于实轴的镜像,绝对值 = 到原点的距离,并能用图说明三角不等式
  • 理解「$\lambda$ 是零点 ⟺ 能提出因式 $z-\lambda$」(4.6),以及「$m$ 次多项式至多 $m$ 个零点」(4.8)为什么推出系数唯一
  • 会做多项式带余除法,并看懂原书用「换一组基」来证明它的线性代数思路(4.9)
  • 理解代数基本定理(4.12、4.13):它说了什么、为什么成立($|p(z)|$ 的最低点只能是零点)
  • 理解实系数多项式的非实零点成对共轭出现(4.14),从而在 ℝ 上分解成一次因式与「判别式 < 0」的二次因式之积(4.16)
  • 知道这些结果在后面(特征值、极小多项式)会怎样被用到
一分钟速览
  • 复数就是平面上的点:$\bar z$ 是 $z$ 关于实轴的镜像,$|z|$ 是它到原点的距离,$z\bar z=|z|^2$;三角不等式 $|w+z|\le|w|+|z|$ 就是「三角形两边之和不小于第三边」。
  • $p(\lambda)=0$ 当且仅当 $p(z)=(z-\lambda)q(z)$——每个零点对应一个一次因式(4.6)。由此 $m$ 次多项式至多有 $m$ 个零点(4.8),多项式的系数和次数都是唯一确定的。
  • 带余除法(4.9):$p=sq+r$ 且 $\deg r\lt\deg s$,就像整数的「商和余数」。原书的证明很漂亮:$1,z,\dots,z^{m-1},s,zs,\dots,z^{n-m}s$ 是一组基,$p$ 在这组基下的坐标前半截就是余式 $r$、后半截就是商 $q$。
  • 代数基本定理(4.12):每个非常数复系数多项式都有复数零点。直观:把 $|p(z)|$ 想成地形,远处很高,所以有最低点;而在任何 $p\ne0$ 的地方总能再往下走——所以最低点就是零点。
  • 于是在 ℂ 上 $p(z)=c(z-\lambda_1)\cdots(z-\lambda_m)$,分解唯一(4.13):$m$ 次复多项式「计重数」恰有 $m$ 个零点。
  • 实系数多项式的非实零点总是成对出现:$\lambda$ 是零点则 $\bar\lambda$ 也是(4.14),零点的分布关于实轴对称。
  • 每对 $\lambda,\bar\lambda$ 合起来是实二次因式 $x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2$(判别式 < 0)。所以 ℝ 上的多项式分解成一次因式和这种二次因式之积(4.16)。
  • 这正是后面「复向量空间上每个算子都有特征值、实空间上却未必(旋转)」的根源:$x^2+1$ 没有实零点。
本章地图 4·1 复数工具箱共轭、|z| 4.1–4.4 4·2 零点⟺一次因式4.6 提出 z − λ 4·4 代数基本定理4.12 ℂ 上必有零点 4·5 二次式实分解4.15 b² ≥ 4c 4·3 带余除法4.9 p = sq + r 4·5 非实根成对4.14 λ 与 λ 同为零点 4·2 至多 m 个零点4.8 ⇒ 系数唯一 4·4 ℂ 上完全分解4.13 c(z−λ₁)⋯(z−λₘ) 4·5 ℝ 上分解4.16 一次×二次因式 第 5 章起的用途 特征值存在 5.19← 4.12、4.6 极小多项式 5.27–5.29← 4.6、4.9、4.13 奇数维有特征值5.34 ← 4.16 ℝ² 的旋转无特征值← x²+1 无实根

点击方框跳到对应小节。实线箭头 = 「推出 / 用到」;虚线 = 在后面章节中被用到。4·1–4·5 是本教材为导航加的编号(原书第 4 章不分字母小节),灰色小标签才是原书编号。

本章约定与读法 standing assumption for this chapter

全章 𝐅 表示 ℝ 或 ℂ。Axler 在章首坦言:这一章「不是线性代数」,很多内容你可能在别的课上见过,老师也许会讲得很快、不要求细究每个证明;但每个结论的陈述都必须读懂——后面几章会反复调用它们。本章有两处真正的线性代数味道值得细读:带余除法的「换基」证明(4.9),以及 ℝ 与 ℂ 的差别(4.12–4.16),后者最终造成了实向量空间与复向量空间上算子理论的差别。

原书章首配图是诗人兼数学家欧玛尔·海亚姆(Omar Khayyam,1048–1131)的雕像,他 1070 年写的代数书第一次认真研究了三次多项式。

4·1 复数补充:共轭与绝对值 Real Part, Imaginary Part, Complex Conjugate, Absolute Value

这一节要解决的问题:研究多项式之前,先把复数的四个基本工具——实部、虚部、共轭、绝对值——备好。它们在后面各有用场:共轭是连接 ℂ 与 ℝ 的桥梁(4.14 靠它证明「非实零点成对出现」),绝对值让我们能谈论 $|p(z)|$ 的大小(代数基本定理 4.12 的证明就是在找 $|p(z)|$ 的最小值)。原书这部分没有单独的小标题,它就是第 4 章的开篇。

回忆第 1 章 1.1:复数是形如 $a+bi$ 的数,$a,b\in\mathbf{R}$,$i^2=-1$。

定义实部、虚部real part, Re z; imaginary part, Im z4.1

设 $z=a+bi$,其中 $a,b$ 是实数。$z$ 的实部定义为 $\operatorname{Re} z=a$,虚部定义为 $\operatorname{Im} z=b$。于是每个复数都可以写成 $z=\operatorname{Re} z+(\operatorname{Im} z)\,i$。

常见误区虚部是实数:$\operatorname{Im}(3+2i)=2$,不是 $2i$。「虚部」只是「$i$ 前面的那个实系数」。
定义复共轭、绝对值complex conjugate, z̄; absolute value, |z|4.2

设 $z\in\mathbf{C}$。

  • $z$ 的复共轭(complex conjugate)记作 $\bar z$,定义为 $\bar z=\operatorname{Re} z-(\operatorname{Im} z)\,i$ ——虚部变号,实部不变。
  • $z$ 的绝对值(absolute value,也叫「模」)记作 $|z|$,定义为 $|z|=\sqrt{(\operatorname{Re} z)^2+(\operatorname{Im} z)^2}$。
例实部、虚部、共轭、绝对值real and imaginary part, complex conjugate, absolute value4.3

设 $z=3+2i$,则 $\operatorname{Re} z=3$,$\operatorname{Im} z=2$;$\bar z=3-2i$;$|z|=\sqrt{3^2+2^2}=\sqrt{13}\approx 3.61$。(在下面的演示里点「例 4.3」按钮就能看到这个点。)

几何图像。把复数 $z$ 对应到平面上的点 $(\operatorname{Re} z,\operatorname{Im} z)\in\mathbf{R}^2$,ℂ 就和 ℝ² 等同起来了——这张平面叫复平面(complex plane),横轴是实轴,纵轴是虚轴。于是:

  • $|z|$ 就是点 $z$ 到原点的距离(勾股定理),所以总是非负数;
  • $\bar z$ 就是 $z$ 关于实轴的镜像;由此一眼看出:$z=\bar z$ 当且仅当 $z$ 落在实轴上,即 $z$ 是实数(原书页边注请读者自行验证这一点);
  • 复数的加法就是 ℝ² 中向量的加法(平行四边形法则)。
直觉:ℂ 既是 1 维的,又是 2 维的 ℂ 作为复向量空间是 1 维的(任何非零复数都能张成整个 ℂ),但把它等同于 ℝ² 后,作为实向量空间是 2 维的(基是 $1, i$)。「维数」取决于你允许用哪种数做数乘——这在后面讨论实向量空间与复向量空间的差别时很关键。
复平面上的共轭、绝对值与三角不等式

拖动蓝点 $w$ 和红点 $z$。用下拉框切换要看的性质:「和」显示 $w+z$ 与三角形(三角不等式);「共轭」显示镜像 $\bar z$,以及 $\operatorname{Re}z=\frac{z+\bar z}{2}$ 与 $(\operatorname{Im}z)i=\frac{z-\bar z}{2}$;「积」显示 $wz$(长度相乘、角度相加)。

「和」模式里,绿色的 $|w+z|$ 永远不超过 $|w|+|z|$;只有当 $w$、$z$ 指向同一方向时(点「让 w、z 同向」),三角形被压扁成一条线段,等号才成立。「共轭」模式里,$z$ 与 $\bar z$ 的中点在实轴上($z+\bar z=2\operatorname{Re}z$ 是实数),两者之差在虚轴上($z-\bar z=2(\operatorname{Im}z)i$ 是纯虚数),而且 $|\bar z|=|z|$。「积」模式里,$wz$ 的长度是 $|w|\,|z|$,方向角是两个方向角之和。

定理复数的性质properties of complex numbers4.4

设 $w,z\in\mathbf{C}$,则下列等式与不等式成立(右列是它们在复平面上的含义):

名称式子几何意义
$z$ 与 $\bar z$ 的和 sum of z and z̄$z+\bar z=2\operatorname{Re} z$$z$ 与镜像的中点在实轴上
$z$ 与 $\bar z$ 的差 difference of z and z̄$z-\bar z=2(\operatorname{Im} z)i$两者的差是竖直的(纯虚数)
$z$ 与 $\bar z$ 的积 product of z and z̄$z\bar z=|z|^2$一个复数乘它的镜像得到非负实数
共轭的可加性与可乘性 additivity and multiplicativity of complex conjugate$\overline{w+z}=\bar w+\bar z$,$\overline{wz}=\bar w\,\bar z$「先算再照镜子」=「先照镜子再算」
二次共轭 double complex conjugate$\bar{\bar z}=z$翻折两次回到原处
实部、虚部不超过 $|z|$ real and imaginary parts are bounded by |z|$|\operatorname{Re} z|\le|z|$,$|\operatorname{Im} z|\le|z|$直角三角形的直角边 ≤ 斜边
共轭的绝对值 absolute value of the complex conjugate$|\bar z|=|z|$镜像不改变到原点的距离
绝对值的可乘性 multiplicativity of absolute value$|wz|=|w|\,|z|$乘法把长度相乘
三角不等式 triangle inequality$|w+z|\le|w|+|z|$三角形任一边 ≤ 另两边之和
证明思路(三角不等式)

除最后一条外都是直接按定义验算(原书留作习题 1)。三角不等式的核心想法:把绝对值的平方写成「自己乘自己的共轭」,展开后交叉项正好是 $2\operatorname{Re}(w\bar z)$,而实部不超过绝对值:

$$\begin{aligned} |w+z|^2 &= (w+z)(\bar w+\bar z) = w\bar w+z\bar z+w\bar z+z\bar w\\ &= |w|^2+|z|^2+w\bar z+\overline{w\bar z}\\ &= |w|^2+|z|^2+2\operatorname{Re}(w\bar z)\\ &\le |w|^2+|z|^2+2|w\bar z| = |w|^2+|z|^2+2|w|\,|z| = (|w|+|z|)^2 . \end{aligned}$$

两边开平方即得 $|w+z|\le|w|+|z|$。用到的性质依次是:$z\bar z=|z|^2$、共轭的可加性与可乘性、$z+\bar z=2\operatorname{Re}z$、$\operatorname{Re}\le|\cdot|$、$|\bar z|=|z|$ 与绝对值的可乘性。等号成立 ⟺ $\operatorname{Re}(w\bar z)=|w\bar z|$,即 $w\bar z$ 是非负实数,也就是 $w$ 与 $z$ 同向。

w z w + z
对应原书 4.4 旁的插图:三角不等式的几何意义——三角形任一边的长度不超过另外两边长度之和。
直觉:乘法 = 伸缩 + 旋转 用极坐标写 $z=r(\cos\theta+i\sin\theta)$($r=|z|$)。由 $|wz|=|w|\,|z|$ 和三角函数的加法公式可知:乘以 $w$ 就是把平面绕原点转过 $w$ 的方向角,再伸缩 $|w|$ 倍。特别地,乘以单位圆上的数只是纯旋转。这个图像在 4.12 的证明里会用到(棣莫弗定理:$k$ 次方就是角度乘 $k$)。
反向三角不等式 原书页边注提醒:还有「反向」版本 $\big||w|-|z|\big|\le|w-z|$(原书习题 2)——两点间的距离不小于它们到原点距离之差。证明见本章末习题 4.2。

在复平面上,$\bar z$ 与 $z$ 是什么几何关系?

什么时候三角不等式取等号,即 $|w+z|=|w|+|z|$?

实部real part, Re z$z=a+bi$ 中的 $a$;复平面上点 $z$ 的横坐标。
虚部imaginary part, Im z$z=a+bi$ 中的 $b$(一个实数,不是 $bi$);点 $z$ 的纵坐标。
复共轭complex conjugate, z̄$\bar z=\operatorname{Re}z-(\operatorname{Im}z)i$:$z$ 关于实轴的镜像;$z\bar z=|z|^2$。
绝对值(模)absolute value, |z|$|z|=\sqrt{(\operatorname{Re}z)^2+(\operatorname{Im}z)^2}$:点 $z$ 到原点的距离;$|wz|=|w||z|$。
三角不等式triangle inequality$|w+z|\le|w|+|z|$:三角形任一边不超过另两边之和;同向时取等号。
反向三角不等式reverse triangle inequality$\big||w|-|z|\big|\le|w-z|$:两点间距离不小于它们到原点距离之差。
本节要点 复数 = 平面上的点:$\operatorname{Re}$、$\operatorname{Im}$ 是坐标,$\bar z$ 是关于实轴的镜像,$|z|$ 是到原点的距离。4.4 的九条性质几乎都能「看图说话」;最有用的两条是 $z\bar z=|z|^2$(把绝对值变成乘法)和共轭与加法、乘法可交换(4.14 要用)。

4·2 多项式的零点 Zeros of Polynomials

这一节要解决的问题:一个多项式最多能有几个零点?答案是「不超过它的次数」(4.8)。关键工具是 4.6:每个零点都对应一个一次因式。副产品是一件看似显然、其实需要证明的事:多项式的系数(从而次数)是唯一确定的。

先回忆第 2 章的记号。函数 $p:\mathbf{F}\to\mathbf{F}$ 称为多项式(polynomial),如果存在 $a_0,\dots,a_m\in\mathbf{F}$ 使得对所有 $z\in\mathbf{F}$ 有 $p(z)=a_0+a_1z+\cdots+a_mz^m$ 2.10;若 $a_m\ne0$,就说 $p$ 的次数(degree)是 $m$,恒为 0 的多项式次数规定为 $-\infty$ 2.11。$\mathcal{P}(\mathbf{F})$ 是全体多项式,$\mathcal{P}_m(\mathbf{F})$ 是次数不超过 $m$ 的多项式,它是 $m+1$ 维的,基为 $1,z,\dots,z^m$ 2.12。

为什么「次数唯一」需要证明? 在本书里多项式是一个函数。两个函数相等,意思是在每一点取值都相同。那么会不会有两组不同的系数给出同一个函数?如果会,「次数」就可能不止一个。原书说:我们的第一个任务就是证明这不会发生。(这个担心并非杞人忧天:在只有 0、1 两个元素的有限域上,$z^2$ 与 $z$ 在每一点的取值都相同!本书的 𝐅 是 ℝ 或 ℂ,有无穷多个元素,4.8 保证了这种事不会发生。——此为补充说明,非原书内容。)
定义多项式的零点zero of a polynomial4.5

数 $\lambda\in\mathbf{F}$ 称为多项式 $p\in\mathcal{P}(\mathbf{F})$ 的零点(zero,也叫根 root),如果 $p(\lambda)=0$。

定理每个零点对应一个一次因式each zero of a polynomial corresponds to a degree-one factor4.6

设 $m$ 是正整数,$p\in\mathcal{P}(\mathbf{F})$ 的次数为 $m$,$\lambda\in\mathbf{F}$。则 $p(\lambda)=0$ 当且仅当存在次数为 $m-1$ 的多项式 $q\in\mathcal{P}(\mathbf{F})$,使得对每个 $z\in\mathbf{F}$ 都有

$$p(z)=(z-\lambda)\,q(z).$$
证明思路

核心想法:$p(z)$ 减去 $p(\lambda)$ 之后,每一项都含有因子 $z-\lambda$。

「⇐」方向是显然的:代入 $z=\lambda$ 得 $p(\lambda)=(\lambda-\lambda)q(\lambda)=0$。

「⇒」方向:设 $p(z)=a_0+a_1z+\cdots+a_mz^m$ 且 $p(\lambda)=0$。那么

$$p(z)=p(z)-p(\lambda)=a_1(z-\lambda)+a_2(z^2-\lambda^2)+\cdots+a_m(z^m-\lambda^m).$$4.7

(常数项 $a_0$ 相减抵消了。)而每个 $z^k-\lambda^k$ 都能提出 $z-\lambda$:

$$z^k-\lambda^k=(z-\lambda)\big(z^{k-1}+\lambda z^{k-2}+\cdots+\lambda^{k-2}z+\lambda^{k-1}\big),$$

括号里是一个 $k-1$ 次多项式(例如 $z^2-\lambda^2=(z-\lambda)(z+\lambda)$,$z^3-\lambda^3=(z-\lambda)(z^2+\lambda z+\lambda^2)$)。把这些提出来的 $z-\lambda$ 合并,就得到 $p(z)=(z-\lambda)q(z)$,其中 $q$ 的最高次项是 $a_mz^{m-1}$,次数恰为 $m-1$。

例:一个接一个地「剥」零点

$p(z)=z^3-6z^2+11z-6$。试一下 $z=1$:$1-6+11-6=0$,所以 $1$ 是零点,按 4.6 可以提出因式:$p(z)=(z-1)(z^2-5z+6)$。再看商 $z^2-5z+6$:它在 $2$ 处为零,于是 $z^2-5z+6=(z-2)(z-3)$。最终 $p(z)=(z-1)(z-2)(z-3)$——三个零点,恰好对应三个一次因式。

拖动零点:零点 ⟺ 一次因式

红点是实多项式 $p(x)=c(x-\lambda_1)(x-\lambda_2)\cdots$ 的零点,可以沿 $x$ 轴拖动(在实轴上画图,所以变量写成 $x$)。被选中(带黑圈)的零点 $\lambda$ 会被「除掉」:绿色虚线是商 $q(x)=p(x)/(x-\lambda)$。勾选「水平线」再拖动 $k$,数一数直线 $y=k$ 与曲线的交点。

绿色的商 $q$ 恰好穿过其余的零点:$p$ 的零点 = $q$ 的零点 ∪ $\{\lambda\}$,而 $q$ 的次数少 1——这正是下面 4.8 的归纳证明。水平线 $y=k$ 与 $m$ 次曲线的交点就是 $p(x)-k$ 的零点,而 $p(x)-k$ 仍是 $m$ 次多项式,所以交点永远不超过 $m$ 个。把 $c$ 拖到 0:$p$ 变成零多项式(次数 $-\infty$),处处为零——这就是 4.8 要求次数 $m\ge1$ 的原因。

定理m 次多项式至多有 m 个零点degree m implies at most m zeros4.8

设 $m$ 是正整数,$p\in\mathcal{P}(\mathbf{F})$ 的次数为 $m$。则 $p$ 在 $\mathbf{F}$ 中至多有 $m$ 个零点。

证明思路

核心想法:每个零点「消耗」一次次数。提出一个零点对应的因式后,商的次数少 1;次数只有 $m$,所以最多提 $m$ 次。

对 $m$ 归纳。$m=1$ 时 $a_0+a_1z$($a_1\ne0$)只有一个零点 $-a_0/a_1$。设 $m\gt1$ 且结论对 $m-1$ 成立。若 $p$ 没有零点,结论已成立;否则取一个零点 $\lambda$,由 4.6 得 $p(z)=(z-\lambda)q(z)$,$\deg q=m-1$。乘积为零当且仅当某个因子为零,所以 $p$ 的零点恰好是 $q$ 的零点再加上 $\lambda$。由归纳假设 $q$ 至多有 $m-1$ 个零点,故 $p$ 至多有 $m$ 个。

重要推论:系数唯一。如果同一个多项式有两组不同的系数,把两种表示相减,就得到一个系数不全为零、却在每个 $z\in\mathbf{F}$ 处都为零的多项式——它有无穷多个零点,与 4.8 矛盾。所以多项式的系数由它(作为函数)唯一确定,次数也就唯一确定了。

直觉:多项式被「足够多的点」锁死 同样的论证说明:两个次数不超过 $m$ 的多项式如果在 $m+1$ 个不同的点取值相同,它们就完全相同(差是次数 ≤ $m$ 却有 $m+1$ 个零点的多项式,只能是 0)。所以「过 $m+1$ 个点的次数 ≤ $m$ 的多项式」最多一个——习题 4.7 会证明它恰好存在一个(插值多项式)。
零多项式的次数 $-\infty$ 原书约定 $\deg 0=-\infty$,并按「期望的方式」运算:对每个整数 $m$,$-\infty\lt m$,$-\infty+m=-\infty$。页边注解释了好处:这样 $\deg(pq)=\deg p+\deg q$ 这类合理的公式就不需要为零多项式开例外。
常见误区 4.8 只是上界。在 ℝ 上 $x^2+1$ 一个零点都没有;$(x-1)^2$ 只有一个零点。「$m$ 次多项式恰有 $m$ 个零点」要到 ℂ 上、并且把重复的零点按重复次数计算时才成立(4.13)。

设 $p$ 是一个次数不超过 3 的多项式,且 $p(1)=p(2)=p(3)=p(4)=0$。关于 $p$ 能得出什么?

已知 5 次多项式 $p$ 满足 $p(-2)=0$。由 4.6 可以断定:

零点 / 根zero / root使 $p(\lambda)=0$ 的数 $\lambda$;它对应一个一次因式:$p(z)=(z-\lambda)q(z)$(4.6)。
次数degree, deg p最高次非零系数的次数;由 4.8 知它唯一确定。约定 $\deg 0=-\infty$。
多项式空间𝒫(𝐅), 𝒫ₘ(𝐅)全体多项式 / 次数 ≤ $m$ 的多项式;$\mathcal{P}_m(\mathbf{F})$ 是 $m+1$ 维的,基为 $1,z,\dots,z^m$。
本节要点 零点 ⟺ 一次因式(4.6);每提出一个一次因式次数降 1,所以 $m$ 次多项式至多 $m$ 个零点(4.8);非零多项式不可能有无穷多个零点 ⇒ 系数和次数唯一。

4·3 多项式的带余除法 Division Algorithm for Polynomials

这一节要解决的问题:整数可以做「带余除法」——$17=5\cdot3+2$,余数比除数小。多项式也可以:用 $s$ 去除 $p$,得到商 $q$ 和余式 $r$,而且「余式比除式小」,只不过这里的「小」是指次数小。这个结果后面会用来研究极小多项式(第 5 章 5.29)。

定理多项式的带余除法division algorithm for polynomials4.9

设 $p,s\in\mathcal{P}(\mathbf{F})$ 且 $s\ne0$。则存在唯一的多项式 $q,r\in\mathcal{P}(\mathbf{F})$,使得

$$p=sq+r\qquad\text{且}\qquad \deg r\lt\deg s .$$
直觉 $q$ 是「$p$ 里面装得下多少个 $s$」,$r$ 是装完剩下的零头。整数里要求 $0\le r\lt s$,多项式里要求 $\deg r\lt\deg s$——次数扮演了「大小」的角色。虽然名字叫 algorithm(算法),原书把它陈述成一个「存在且唯一」的结论;具体怎么算,就是中学学过的多项式长除法。

先用长除法算一个例子,体会「每一步消掉最高次项」:

第 1 步:准备

用 $s(z)=z^2+1$ 去除 $p(z)=z^4+2z^3-z+3$(注意 $z^2$ 项的系数是 0)。目标:找 $q,r$ 使 $p=sq+r$ 且 $\deg r\lt 2$。策略:每一步用「某个单项式 × $s$」抵消当前余式的最高次项。

第 2 步:消掉 $z^4$

最高次项 $z^4$ 除以 $s$ 的最高次项 $z^2$ 得 $z^2$。减去 $z^2\cdot s=z^4+z^2$:余式变成 $2z^3-z^2-z+3$。商记下 $z^2$。

第 3 步:消掉 $2z^3$

$2z^3\div z^2=2z$。减去 $2z\cdot s=2z^3+2z$:余式变成 $-z^2-3z+3$。商记下 $+2z$。

第 4 步:消掉 $-z^2$

$-z^2\div z^2=-1$。减去 $(-1)\cdot s=-z^2-1$:余式变成 $-3z+4$。商记下 $-1$。

第 5 步:停止

余式 $-3z+4$ 的次数是 $1\lt 2=\deg s$,停止。得到 $q(z)=z^2+2z-1$,$r(z)=-3z+4$。验算:$(z^2+1)(z^2+2z-1)+(-3z+4)=z^4+2z^3+2z-1-3z+4=z^4+2z^3-z+3$ ✓。

第 6 步:换个角度读结果(原书的证明)

我们一共减去了 $1\cdot z^2s$、$2\cdot zs$、$(-1)\cdot s$,剩下 $-3z+4$。也就是说 $p=1\cdot(z^2s)+2\cdot(zs)+(-1)\cdot s+(-3)\cdot z+4\cdot 1$——这正是 $p$ 在 $z^2s,\ zs,\ s,\ z,\ 1$ 这组基下的坐标!前三个坐标 $(1,2,-1)$ 组成商 $q$,后两个 $(-3,4)$ 组成余式 $r$。

原书的证明:换一组基 a linear-algebra proof

带余除法当然可以不用线性代数证明;但 Axler 说,作为线性代数教材,这里给一个用线性代数的证明,而且「即使你熟悉别的证明也值得一读」。它巧妙地使用了 $\mathcal{P}_n(\mathbf{F})$ 的一组基。设 $n=\deg p$,$m=\deg s$。

  • 若 $n\lt m$:取 $q=0$,$r=p$ 即可。
  • 若 $n\ge m$:考虑下面这个长度为 $n+1$ 的组
$$1,\ z,\ \dots,\ z^{m-1},\ \ s,\ zs,\ \dots,\ z^{n-m}s$$4.10

它们的次数分别是 $0,1,\dots,m-1,\ m,m+1,\dots,n$——各不相同,所以线性无关(次数最高的那个无法被其余的组合出来);长度 $n+1=\dim\mathcal{P}_n(\mathbf{F})$,所以由 2.38(长度对的线性无关组是基)它是 $\mathcal{P}_n(\mathbf{F})$ 的一组基。把 $p$ 在这组基下展开:

$$p=\underbrace{a_0+a_1z+\cdots+a_{m-1}z^{m-1}}_{r}+s\,\underbrace{(b_0+b_1z+\cdots+b_{n-m}z^{n-m})}_{q}$$4.11

前半截是次数 $\lt m$ 的 $r$,后半截提出 $s$ 就是 $sq$。唯一性也白送:一个向量在一组基下的坐标是唯一的。

带余除法 = 在「阶梯形」基下求坐标

选一个例子,或自己输入 $p$、$s$ 的系数(从高次到低次,用空格分隔,可以用分数如 1/2)。上图:矩阵的每一列是一个基向量(4.10)在标准基 $z^n,\dots,z,1$ 下的系数,右边的列向量是 $p$ 的系数;中间是 $p$ 在新基下的坐标——上半截(橙)是商 $q$,下半截(绿)是余式 $r$。下图比较 $p/s$ 与 $q$ 的图像。

橙色列:$s$ 的平移 $z^js$(坐标 → 商 $q$)绿色列:$1,z,\dots,z^{m-1}$(坐标 → 余式 $r$)粗框:对角线 = 各列首项系数 ≠ 0

矩阵总是「阶梯形」(对角线以上全是 0):每一列的次数都不同,对角线上是各列的首项系数(1 或 $s$ 的首项系数),都不为 0,所以这组向量线性无关、构成基。解这个三角方程组时从最上面一行往下逐个求坐标——第一行给出 $q$ 的最高次系数,然后减掉、再看下一行……这恰好就是长除法!下图中,离原点越远,$p/s$ 的曲线越贴近 $q$:因为 $p/s=q+r/s$,而 $\deg r\lt\deg s$ 使 $r/s\to0$,就像 $17/5=3+2/5$。

补充:除以 $z-\lambda$ 的余数就是 $p(\lambda)$ 取 $s(z)=z-\lambda$。余式次数 $\lt1$,所以是常数 $r$;在 $p(z)=(z-\lambda)q(z)+r$ 中代入 $z=\lambda$ 得 $r=p(\lambda)$(常称「余数定理」remainder theorem,原书未单列)。于是 $p(\lambda)=0$ ⟺ 余数为 0 ⟺ $z-\lambda$ 整除 $p$——这是 4.6 的另一种看法。演示中选第 2 个例子可以验证:余式 $31=p(2)$。
往后看 第 5 章 5.29 用带余除法证明:$q(T)=0$ 当且仅当 $q$ 是 $T$ 的极小多项式 $p$ 的倍式。做法是写 $q=ps+r$,$\deg r\lt\deg p$,于是 $r(T)=q(T)-p(T)s(T)=0$,而 $p$ 是「次数最小」的,只能 $r=0$。

用 $s(z)=z^2+1$ 去除任意多项式 $p$,余式 $r$ 可能是什么样的?

原书证明带余除法($n=\deg p\ge m=\deg s$)的关键一步是什么?

带余除法division algorithm for polynomials$s\ne0$ 时存在唯一的 $q,r$ 使 $p=sq+r$ 且 $\deg r\lt\deg s$(4.9)。
商与余式quotient, remainder$p=sq+r$ 中的 $q$ 与 $r$;$p/s=q+r/s$,远处 $p/s\approx q$。
本节要点 带余除法 $p=sq+r$,$\deg r\lt\deg s$,$q,r$ 唯一(4.9)。线性代数视角:$1,\dots,z^{m-1},s,\dots,z^{n-m}s$ 每个次数不同 ⇒ 是 $\mathcal{P}_n(\mathbf{F})$ 的基;$p$ 的坐标前半截是 $r$、后半截是 $q$;长除法就是解这个阶梯形方程组。

4·4 ℂ 上多项式的因式分解 Factorization of Polynomials over C

这一节要解决的问题:到目前为止 𝐅 同时代表 ℝ 和 ℂ,结论对两者都成立;从这里开始两者分道扬镳。先处理复系数多项式,核心是代数基本定理:每个非常数多项式都有零点。有了它,再反复使用 4.6,就能把多项式一路分解成一次因式之积。下一节再用这里的结果推出实系数的情形。

原书页边注:它是一个「存在性定理」
  • 代数基本定理只保证零点存在,它的证明并不给出求零点的方法。二次多项式有求根公式;三次、四次有类似但复杂得多的公式;五次及以上不存在这样的公式。
  • 它的每一种证明都要用到一点「分析」(连续性、极限),因为如果把 ℂ 换成 $\{c+di: c,d\text{ 是有理数}\}$,定理就不成立了(例如 $z^2-2$ 的零点 $\pm\sqrt2$ 不在其中——此例为补充)。原书的证明隐含地用到:闭圆盘上的连续实值函数一定取得最小值。
  • 还有很多别的证明;如果你熟悉解析函数,用 Liouville 定理的证明特别漂亮。
定理代数基本定理(第一版)fundamental theorem of algebra, first version4.12

每个非常数的复系数多项式都在 $\mathbf{C}$ 中有零点。

直觉:|p(z)| 的地形,最低点只能是零点 把 $|p(z)|$ 想成复平面上方的「地形高度」。
① 远处很高:$|z|$ 很大时 $|p(z)|\approx|c_m|\,|z|^m$ 越来越大,所以地形像一个大碗,一定有最低点。
② 非零处总能往下走:在任何 $p(\zeta)\ne0$ 的点,总能找到一个方向,沿它走一小步 $|p|$ 就变小——所以那里不是最低点。
③ 于是最低点处只能 $p=0$:零点存在。下面的演示把 ② 画了出来。
|p(z)| 的地形图:非零处总有下坡方向

底图是复平面上 $|p(z)|$ 的「高度」:颜色越蓝越低,细纹是等高线(相邻两条高度相差一倍)。拖动红点 $\zeta$:绿色箭头是证明中的「下坡方向」$\beta$(见下面步骤播放器的第 4 步)。点「沿箭头下山」看 $\zeta$ 一路走到某个零点(紫圈);拖动 δ 给常数项加上 δ,看各个「坑」如何移动。

无论把 $\zeta$ 放在哪里,只要 $p(\zeta)\ne0$ 就有绿色箭头,沿箭头 $|p|$ 立刻变小;箭头只会在零点处消失。所以地形的最低点必然是零点。一般的点只有 1 个下坡方向($k=1$,此时 $\beta$ 正是牛顿迭代的方向);在 $p'(\zeta)=0$ 的「鞍点」处 $k\ge2$,会出现 $k$ 个下坡方向——例如 $z^3+1$ 在 0 处的 3 个方向恰好指向 3 个零点。这就是为什么证明里需要 $k$ 次方根。拖动 δ,坑会移动、合并、分开,但数目(计重数)始终等于次数。

下面把原书的证明拆成五步(示例取 $p(z)=z^3+z^2+1$,在点 $\zeta=0$ 处演示「这里不可能是最低点」):

第 1 步:远处很高,所以有最低点

若 $p$ 的最高次项是 $c_mz^m$($m\ge1$),则 $|z|\to\infty$ 时 $|p(z)|/|z^m|\to|c_m|$,所以 $|p(z)|\to\infty$。图中:大圆 $|z|=2$ 被 $p$ 映成右边一条远离原点的大曲线,圆上处处 $|p|\ge3\gt1=|p(0)|$。所以 $|p|$ 的最小值只能在这个圆盘里取得——而闭圆盘上的连续函数一定有最小值(证明中唯一用到的「分析」)。设最小值在 $\zeta$ 处取得。

第 2 步:反设 $p(\zeta)\ne0$,并归一化

令 $q(z)=p(z+\zeta)/p(\zeta)$:把最低点平移到原点,并把那里的值缩放成 1。于是 $q(0)=1$,而且 $|q(z)|\ge1$ 对所有 $z$ 成立——$q$ 的值只能落在单位圆上或圆外,右图中单位圆内部是「禁区」。示例中 $\zeta=0$,$p(0)=1$,所以 $q=p$。

第 3 步:看最低阶的非零项

写 $q(z)=1+a_kz^k+\cdots+a_mz^m$,$a_k\ne0$ 是常数项之后第一个非零系数。示例中 $q(z)=1+z^2+z^3$,$k=2$。$|z|=t$ 很小时 $q(z)\approx1+a_kz^k$:左边的小圆被映成绕着 1 转 $k$ 圈的小环,它必有一部分钻进单位圆内(红色),那里 $|q|\lt1$,与「禁区」矛盾——剩下的只是把这件事严格化。

第 4 步:选方向 $\beta$,让主要项正对原点

取 $\beta$ 使 $\beta^k=-1/a_k$(由棣莫弗定理,任何复数都有 $k$ 次方根;示例中 $\beta^2=-1$,$\beta=\pm i$)。沿 $z=t\beta$ 走:$a_k(t\beta)^k=-t^k$ 是一个负实数,正好把 $q$ 的值从 1 笔直推向原点。右图画出 $t\mapsto q(t\beta)$ 的两条轨迹:起步时笔直朝向原点,走远了才被更高次项掰弯。

第 5 步:估计余项,得到矛盾

对 $0\lt t\lt1$,更高次的项合起来不超过 $t^{k+1}c$($c\gt1$ 是某个常数),所以 $|q(t\beta)|\le(1-t^k)+t^{k+1}c=1-t^k(1-tc)$。取 $t=1/(2c)$ 就得到 $|q(t\beta)|\lt1$,与「$|q|$ 的最小值是 1」矛盾。因此 $p(\zeta)=0$:最低点就是零点。

4.12 的完整证明(原书)

准备:$k$ 次方根存在。棣莫弗定理(对 $k$ 归纳并用三角函数的加法公式):对正整数 $k$ 和 $\theta\in\mathbf{R}$,$(\cos\theta+i\sin\theta)^k=\cos k\theta+i\sin k\theta$。任给 $w\in\mathbf{C}$,写成极坐标 $w=r(\cos\theta+i\sin\theta)$,$r\ge0$,则 $\big(r^{1/k}(\cos\tfrac{\theta}{k}+i\sin\tfrac{\theta}{k})\big)^k=w$。所以每个复数都有 $k$ 次方根。

最小值存在。设 $p$ 非常数,最高次非零项为 $c_mz^m$。因为 $|p(z)|/|z^m|\to|c_m|$,所以 $|z|\to\infty$ 时 $|p(z)|\to\infty$。于是连续函数 $z\mapsto|p(z)|$ 在某点 $\zeta\in\mathbf{C}$ 取得全局最小值。反设 $p(\zeta)\ne0$。

归一化。令 $q(z)=p(z+\zeta)/p(\zeta)$,则 $z\mapsto|q(z)|$ 在 $z=0$ 取得全局最小值 1。写 $q(z)=1+a_kz^k+\cdots+a_mz^m$,其中 $k$ 是使 $z^k$ 系数非零的最小正整数,即 $a_k\ne0$。

往下走。取 $\beta\in\mathbf{C}$ 使 $\beta^k=-1/a_k$。存在常数 $c\gt1$,使得对 $t\in(0,1)$:

$$|q(t\beta)|\le\big|1+a_kt^k\beta^k\big|+t^{k+1}c=1-t^k(1-tc).$$

($|1+a_kt^k\beta^k|=|1-t^k|=1-t^k$;余下各项 $a_j(t\beta)^j$,$j\gt k$,的绝对值之和不超过 $t^{k+1}\sum_{j\gt k}|a_j||\beta|^j$,取 $c$ 比这个和大且 $\gt1$ 即可。)取 $t=1/(2c)$ 得 $|q(t\beta)|\lt1$,与 $|q|$ 的最小值为 1 矛盾。所以 $p(\zeta)=0$,$p$ 有零点。

另一种直观:圆周的像绕原点几圈?

左图:半径为 $R$ 的圆(蓝)与 $p$ 的零点(紫点,可拖动;圈内的实心、圈外的空心)。右图:圆上的点 $z$ 被映到 $w=p(z)$,蓝色曲线是整个圆的像(已自动缩放,绿点是原点)。拖动 $R$;拖动 $\theta$ 滑块(或按「播放」)让 $z=Re^{i\theta}$ 绕圆一周,看 $w$ 绕原点转了几圈。

像曲线绕原点的圈数(绕数 winding number)总是等于圆内零点的个数(重零点按重复次数计)。$R$ 很大时 $p(z)\approx z^m$,像绕 $m$ 圈;$R$ 很小时像缩成 $p(0)$ 附近的一小团,绕 0 圈。$R$ 连续变化时,圈数只能在像曲线扫过原点的那一刻改变——也就是圆扫过零点的时候。倘若 $p$ 没有零点,圈数就永远不变,却又必须从 0 变到 $m$,矛盾!这是代数基本定理的另一种(拓扑的)证明思路,不是原书的证明,但它还顺便告诉你:零点一共恰有 $m$ 个。

存在 ≠ 能写出来 计算机可以用巧妙的数值方法求出任何多项式零点的高精度近似,即使精确的零点写不出来。例如原书说:没有人能给出 $p(x)=x^5-5x^4-6x^3+17x^2+4x-7$ 的零点的精确公式,但计算机求得它的五个零点约为 $-1.87,\ -0.74,\ 0.62,\ 1.47,\ 5.51$。(在上面的地形图里选「原书例」,能看到实轴上的五个「坑」。)

第一版只保证「至少一个」零点。把它和 4.6 交替使用——找一个零点、提出一个一次因式、对商重复——就得到完整的分解:

定理代数基本定理(第二版)fundamental theorem of algebra, second version4.13

若 $p\in\mathcal{P}(\mathbf{C})$ 是非常数多项式,则 $p$ 有唯一(不计因式的顺序)的分解

$$p(z)=c\,(z-\lambda_1)\cdots(z-\lambda_m),$$

其中 $c,\lambda_1,\dots,\lambda_m\in\mathbf{C}$。$p$ 的零点恰好是 $\lambda_1,\dots,\lambda_m$——右边只在这些 $z$ 处为零。

证明思路

存在性:对 $m=\deg p$ 归纳。$m=1$ 时显然。$m\gt1$ 时,由 4.12,$p$ 有零点 $\lambda$;由 4.6,$p(z)=(z-\lambda)q(z)$,$\deg q=m-1$;由归纳假设 $q$ 已分解,代回即得 $p$ 的分解。

唯一性:$c$ 必须是 $z^m$ 的系数,所以只需证 $\lambda$ 们(不计顺序)唯一。若 $(z-\lambda_1)\cdots(z-\lambda_m)=(z-\tau_1)\cdots(z-\tau_m)$ 对所有 $z$ 成立:代入 $z=\lambda_1$,左边为 0,所以某个 $\tau$ 等于 $\lambda_1$,不妨设 $\tau_1=\lambda_1$。对 $z\ne\lambda_1$ 两边除以 $z-\lambda_1$,得 $(z-\lambda_2)\cdots(z-\lambda_m)=(z-\tau_2)\cdots(z-\tau_m)$。这个等式其实对所有 $z$ 成立(否则两边之差是一个有无穷多个零点的非零多项式,与 4.8 矛盾)。再由归纳假设即得。

重复的零点与「计重数」 分解中的 $\lambda_j$ 可以重复。例如 $z^3-3z+2=(z-1)^2(z+2)$:不同的零点只有 $1$ 和 $-2$,但因式 $z-1$ 出现了两次。若把重复出现的零点按重复次数计算(常说「计重数」),则 $m$ 次复系数多项式在 ℂ 中恰有 $m$ 个零点——4.8 的上界在 ℂ 上总能取到。
往后看 第 5 章 5.19「有限维非零复向量空间上的每个算子都有特征值」的证明,核心就是 4.12 + 4.6:先找一个使 $p(T)v=0$ 的非常数多项式 $p$,用 4.12 找到 $p$ 的零点 $\lambda$,再用 4.6 写 $p(z)=(z-\lambda)q(z)$,于是 $(T-\lambda I)(q(T)v)=0$,$\lambda$ 就是特征值。5.27 又用 4.13 说明:在 ℂ 上,极小多项式可以写成 $(z-\lambda_1)\cdots(z-\lambda_m)$,$\lambda$ 们正是全部特征值。

代数基本定理(4.12)保证了什么?

一个 6 次复系数多项式在 ℂ 中有几个零点?

代数基本定理fundamental theorem of algebra非常数复系数多项式必有复零点(4.12);于是 $p=c(z-\lambda_1)\cdots(z-\lambda_m)$,分解唯一(4.13)。
棣莫弗定理De Moivre's theorem$(\cos\theta+i\sin\theta)^k=\cos k\theta+i\sin k\theta$;由此每个复数都有 $k$ 次方根。
绕数winding number闭曲线绕原点转的圈数。$|z|=R$ 的像的绕数 = 圆内零点个数(补充视角,非原书内容)。
本节要点 代数基本定理:ℂ 上非常数多项式必有零点(4.12)。证明图像:$|p|$ 的地形远处高、非零处总有下坡 ⇒ 最低点是零点。与 4.6 结合反复剥因式 ⇒ $p=c(z-\lambda_1)\cdots(z-\lambda_m)$ 且唯一(4.13),计重数恰有 $m$ 个零点。它只保证存在,不给公式。

4·5 ℝ 上多项式的因式分解 Factorization of Polynomials over R

这一节要解决的问题:实系数多项式可能一个实零点也没有,比如 $1+x^2$——代数基本定理在 ℝ 上不成立。那么在 ℝ 上最好能分解到什么程度?答案:一次因式与「没有实零点」的二次因式之积。策略是借道 ℂ:先在 ℂ 上完全分解(4.13),再把成对出现的共轭零点重新组合成实的二次因式。

原书页边注 代数基本定理在 ℝ 上的失效,正是后面各章中实向量空间与复向量空间上的线性代数种种差别的根源。例如 ℝ² 上逆时针旋转 90° 的算子 $T(w,z)=(-z,w)$ 没有特征值(第 5 章例 5.9),归根结底是因为 $x^2+1$ 没有实零点;而在 ℂ² 上它有特征值 $\pm i$。
定理实系数多项式的非实零点成对出现polynomials with real coefficients have nonreal zeros in pairs4.14

设 $p\in\mathcal{P}(\mathbf{C})$ 的系数都是实数。若 $\lambda\in\mathbf{C}$ 是 $p$ 的零点,则 $\bar\lambda$ 也是 $p$ 的零点。

证明思路

核心想法:对方程两边取共轭,实系数不受影响。设 $p(z)=a_0+a_1z+\cdots+a_mz^m$,$a_j$ 都是实数,且 $a_0+a_1\lambda+\cdots+a_m\lambda^m=0$。两边取共轭,用 4.4(共轭的可加性与可乘性,以及实数的共轭是它自己)得

$$a_0+a_1\bar\lambda+\cdots+a_m\bar\lambda^m=0,$$

即 $p(\bar\lambda)=0$。

直觉:实系数多项式分不清 $i$ 和 $-i$ 实系数多项式里出现的只有实数;把整个世界「照一次镜子」(所有复数取共轭,$i\leftrightarrow -i$),它的方程一点都不变。所以它的零点集合也必须在镜像下不变——零点在复平面上关于实轴对称。例如第 5 章 5.28 的 $z^5-6z+3$ 的两个非实零点 $-0.12\pm1.59i$ 就互为共轭;$x^2-4x+13$ 的零点是 $2\pm3i$。

接下来研究最简单的情形——二次式。原书提示:想想求根公式。

定理二次多项式的分解factorization of a quadratic polynomial4.15

设 $b,c\in\mathbf{R}$。则存在形如 $x^2+bx+c=(x-\lambda_1)(x-\lambda_2)$、且 $\lambda_1,\lambda_2\in\mathbf{R}$ 的分解,当且仅当 $b^2\ge4c$。

证明思路

核心想法:配方(completing the square,原书页边注说这个恒等式就是「配方法」的基础):

$$x^2+bx+c=\Big(x+\frac b2\Big)^2+\Big(c-\frac{b^2}{4}\Big).$$

若 $b^2\lt4c$,右边对每个实数 $x$ 都是正的,所以没有实零点,自然不能写成 $(x-\lambda_1)(x-\lambda_2)$,$\lambda_1,\lambda_2\in\mathbf{R}$。反之若 $b^2\ge4c$,取实数 $d$ 使 $d^2=\frac{b^2}{4}-c$,则

$$x^2+bx+c=\Big(x+\frac b2\Big)^2-d^2=\Big(x+\frac b2+d\Big)\Big(x+\frac b2-d\Big).$$
直觉:看抛物线的顶点 配方把 $y=x^2+bx+c$ 写成「顶点式」:顶点在 $\big(-\frac b2,\ c-\frac{b^2}{4}\big)$。开口向上的抛物线碰到 $x$ 轴 ⟺ 顶点不在 $x$ 轴上方 ⟺ $c-\frac{b^2}{4}\le0$ ⟺ $b^2\ge4c$。顶点一旦升到 $x$ 轴上方,两个实零点就「相撞」然后变成一对共轭复数零点。
二次式:顶点的高度决定实零点还是共轭零点

左图:拖动紫色顶点,抛物线 $y=x^2+bx+c$ 随之平移(顶点 = $(-b/2,\ c-b^2/4)$)。右图:两个零点 $\lambda_1,\lambda_2$ 在复平面上的位置,也可以直接拖动它们。

慢慢把顶点往上拖:两个实零点相互靠近,在顶点碰到 $x$ 轴时重合($b^2=4c$),越过之后它们「拐个直角」沿竖直方向分开,成为一对关于实轴对称的共轭零点 $h\pm i\sqrt{k}$——其中 $h$ 是顶点横坐标,$k$ 是顶点高度。所以顶点高度 = $(\operatorname{Im}\lambda)^2$。

反过来,每一对共轭零点 $\lambda,\bar\lambda$($\lambda\notin\mathbf{R}$)合起来给出一个实系数的二次因式:

$$(x-\lambda)(x-\bar\lambda)=x^2-2(\operatorname{Re}\lambda)\,x+|\lambda|^2 .$$

(用了 4.4:$\lambda+\bar\lambda=2\operatorname{Re}\lambda$,$\lambda\bar\lambda=|\lambda|^2$。)它的判别式 $4(\operatorname{Re}\lambda)^2-4|\lambda|^2=-4(\operatorname{Im}\lambda)^2\lt0$,正是 4.15 中「不能再在 ℝ 上分解」的那种二次式。

要小心的一点(原书特意指出) 上面的想法「几乎」就是 4.16 的证明,但有个漏洞:4.14 只保证 $\bar\lambda$ 也是零点,并没有保证 $x-\lambda$ 与 $x-\bar\lambda$ 在分解中出现的次数相同,而把它们两两配对需要这一点。原书的证明巧妙地绕开了它:不去数重复次数,而是直接把二次因式除掉,再证明商仍是实系数的,然后归纳(见下面的证明)。
定理ℝ 上多项式的因式分解factorization of a polynomial over R4.16

设 $p\in\mathcal{P}(\mathbf{R})$ 是非常数多项式。则 $p$ 有唯一(不计因式的顺序)的分解

$$p(x)=c(x-\lambda_1)\cdots(x-\lambda_m)(x^2+b_1x+c_1)\cdots(x^2+b_Mx+c_M),$$

其中 $c,\lambda_1,\dots,\lambda_m,b_1,\dots,b_M,c_1,\dots,c_M\in\mathbf{R}$,且每个 $k$ 都有 $b_k^2\lt4c_k$。

注:$m$ 或 $M$ 可以是 0。$\lambda_1,\dots,\lambda_m$ 恰好是 $p$ 的全部实零点——右边只在这些实数处为零(二次因式在 ℝ 上恒正)。

证明思路

存在性:把 $p$ 看成 $\mathcal{P}(\mathbf{C})$ 的元素。若它的复零点全是实数,由 4.13 已得所需分解。否则取一个零点 $\lambda\notin\mathbf{R}$,由 4.14 $\bar\lambda$ 也是零点,于是(用两次 4.6)

$$p(x)=(x-\lambda)(x-\bar\lambda)q(x)=\big(x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2\big)q(x),$$

$q\in\mathcal{P}(\mathbf{C})$ 的次数比 $p$ 少 2。关键是证明 $q$ 的系数是实数:对每个实数 $x$,$q(x)=\dfrac{p(x)}{x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2}$ 是实数除以(非零)实数,所以是实数。写 $q(x)=a_0+a_1x+\cdots+a_{n-2}x^{n-2}$($a_j\in\mathbf{C}$),则对所有实数 $x$ 都有 $0=\operatorname{Im}q(x)=(\operatorname{Im}a_0)+(\operatorname{Im}a_1)x+\cdots+(\operatorname{Im}a_{n-2})x^{n-2}$——一个有无穷多个零点的多项式,由 4.8 它的系数全为 0,即所有 $a_j$ 都是实数。对 $q$ 用归纳法即得 $p$ 的分解。

唯一性:每个满足 $b_k^2\lt4c_k$ 的因式 $x^2+b_kx+c_k$ 都能唯一地写成 $(x-\lambda_k)(x-\bar\lambda_k)$,$\lambda_k\in\mathbf{C}$。于是 $p$ 在 $\mathcal{P}(\mathbf{R})$ 中的两种不同分解会给出它在 $\mathcal{P}(\mathbf{C})$ 中的两种不同分解,与 4.13 矛盾。

实系数多项式:零点关于实轴对称 → ℝ 上的分解

左图:多项式 $p$ 的零点(首项系数 1)。红点是实零点,只能沿实轴拖;紫色实心点和它的镜像(空心)是一对共轭零点,拖动其中一个,另一个自动镜像跟随。右图:$y=p(x)$ 在实轴上的图像,紫色虚线是每对共轭零点对应的实二次因式。勾选「解除共轭约束」后,镜像不再跟随,看看会发生什么。

只要零点关于实轴对称,展开后的系数就全是实数,右边能画出实函数图像:它只在红点处穿过 $x$ 轴,每对共轭零点只贡献一个恒正的二次因式(紫色虚线,顶点在 $x$ 轴上方),这就是 4.16。解除约束、把一个零点拖离镜像位置后,系数立刻出现虚部,$p(x)$ 在实轴上取复数值(右图改画实部与虚部)——这是 4.14 的逆否说法:零点不对称,系数就不可能全是实数。「$(x^2+1)^2$」一例中同一对共轭零点出现两次,正是原书证明要小心处理的情形。

往后看 ① 奇数次实多项式一定有实零点(习题 4.9):4.16 中 $\deg p=m+2M$ 为奇数迫使 $m\ge1$。第 5 章 5.34 就用 4.16 证明了「奇数维实向量空间上的每个算子都有特征值」。② 第 5 章(5.27 之后的讨论与例 5.28)指出:求特征值等价于求多项式的零点,所以对某些算子(如 $\mathbf{C}^5$ 上以 $z^5-6z+3$ 为极小多项式的算子)不可能写出特征值的精确表达式——这正是「五次及以上没有求根公式」的回响。

实系数多项式 $p$ 有零点 $2+3i$。下面哪个结论一定成立?

下面哪个二次式不能在 ℝ 上分解成两个一次因式之积?

非实零点成对出现nonreal zeros in pairs实系数多项式若以 $\lambda$ 为零点,则 $\bar\lambda$ 也是零点(4.14);零点关于实轴对称。
配方completing the square$x^2+bx+c=(x+\frac b2)^2+(c-\frac{b^2}{4})$;有实分解 ⟺ $b^2\ge4c$(4.15)。
实二次因式quadratic factor with b² < 4c$(x-\lambda)(x-\bar\lambda)=x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2$,在 ℝ 上恒正、不能再分解(常称「不可约二次因式」irreducible quadratic)。
ℝ 上的因式分解factorization of a polynomial over R$p=c\prod(x-\lambda_j)\prod(x^2+b_kx+c_k)$,$b_k^2\lt4c_k$,唯一(4.16)。
本节要点 实系数 ⇒ 零点关于实轴对称(4.14);二次式有实分解 ⟺ $b^2\ge4c$(4.15,配方/顶点高度);共轭对 $\lambda,\bar\lambda$ 合成实二次因式 $x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2$;于是 ℝ 上的多项式 = 一次因式 × 判别式为负的二次因式,且唯一(4.16)。证明的巧妙之处:除掉二次因式后用 4.8 说明商的系数是实数。

本章小结

  • 复数工具(4.1–4.4):$\operatorname{Re}z,\operatorname{Im}z$ 是坐标;$\bar z$ 是关于实轴的镜像;$|z|$ 是到原点的距离;$z\bar z=|z|^2$;共轭与加法、乘法可交换;$|wz|=|w||z|$;三角不等式 $|w+z|\le|w|+|z|$。
  • 零点与因式(4.5–4.8):$p(\lambda)=0$ ⟺ $p(z)=(z-\lambda)q(z)$;$m$ 次多项式至多 $m$ 个零点 ⇒ 系数与次数唯一;$\deg 0=-\infty$。
  • 带余除法(4.9–4.11):$p=sq+r$,$\deg r\lt\deg s$,$q,r$ 唯一。线性代数证明:$1,\dots,z^{m-1},s,\dots,z^{n-m}s$ 次数各不相同 ⇒ 是 $\mathcal{P}_n(\mathbf{F})$ 的基,坐标给出 $r$ 与 $q$;长除法 = 解阶梯形方程组。
  • ℂ 上(4.12–4.13):代数基本定理——$|p|$ 的最低点只能是零点;反复剥因式得 $p=c(z-\lambda_1)\cdots(z-\lambda_m)$,唯一;计重数恰有 $m$ 个零点。
  • ℝ 上(4.14–4.16):非实零点成对共轭出现;$x^2+bx+c$ 有实分解 ⟺ $b^2\ge4c$;$p=c\prod(x-\lambda_j)\prod(x^2+b_kx+c_k)$,$b_k^2\lt4c_k$,唯一。

概念之间的联系:4.6 是整章的「发动机」——它把「找到一个零点」变成「次数降 1」。配上「零点至多 $m$ 个」(4.8)得到唯一性,配上「零点一定存在」(4.12)得到 ℂ 上的完全分解(4.13),再配上共轭对称(4.14)得到 ℝ 上的分解(4.16)。带余除法(4.9)是另一条独立的线,它的证明展示了「选一组好基」的威力。

𝐅 = ℂ𝐅 = ℝ
非常数多项式一定有零点?是(4.12)否,如 $x^2+1$
最终分解成一次因式之积(4.13)一次因式 × 判别式 < 0 的二次因式(4.16)
零点个数(计重数)恰好 $=\deg p$$\deg p-2M$(与 $\deg p$ 同奇偶)
零点在复平面上的分布任意关于实轴对称(4.14)
对后面算子理论的影响有限维非零空间上每个算子都有特征值(5.19)可能没有(旋转,例 5.9);奇数维一定有(5.34)

自测

一个 5 次实系数多项式,关于它的实零点能说什么?

$x^4+1$ 在 ℝ 上的分解(4.16 的形式)是什么?

已知多项式 $p$ 满足 $p(3)=7$。用 $z-3$ 去除 $p$,余式是什么?

把 ℂ 看作向量空间,它的维数是多少?

习题

习题选自原书 Exercises 4;编号「4.k」指原书第 4 章习题的第 k 题(与正文结果编号 4.k 无关)。先自己想,再看提示和解答。

4.2证明反向三角不等式:对 $w,z\in\mathbf{C}$,$\big||w|-|z|\big|\le|w-z|$。
提示把 $w$ 写成 $(w-z)+z$,对它用三角不等式;再交换 $w$ 与 $z$ 的角色。
参考解答

由三角不等式,$|w|=|(w-z)+z|\le|w-z|+|z|$,所以 $|w|-|z|\le|w-z|$。交换 $w,z$ 得 $|z|-|w|\le|z-w|=|w-z|$。而 $\big||w|-|z|\big|$ 等于 $|w|-|z|$ 与 $|z|-|w|$ 中较大的那个,两者都 $\le|w-z|$,得证。几何意义:两点 $w,z$ 之间的距离,不小于它们到原点距离之差。

4.4设 $m$ 是正整数。集合 $\{0\}\cup\{p\in\mathcal{P}(\mathbf{F}):\deg p=m\}$ 是 $\mathcal{P}(\mathbf{F})$ 的子空间吗?(习题 4.5 问的是「次数为偶数的多项式再加上 0」,同样思路。)
提示找两个次数都是 $m$ 的多项式,让它们的最高次项相消。
参考解答

不是。它包含 0、对数乘封闭,但对加法不封闭:$z^m+1$ 与 $-z^m$ 的次数都是 $m$,它们的和 $1$ 的次数是 0,既不是 $m$ 也不是零多项式。

习题 4.5 同理也不是子空间:$z^2+z$ 与 $-z^2$ 次数都是偶数 2,和 $z$ 的次数是 1。对比:「次数 ≤ $m$」的多项式 $\mathcal{P}_m(\mathbf{F})$ 是子空间——相加不会让次数升高。

4.6设正整数 $m\le n$,$\lambda_1,\dots,\lambda_m\in\mathbf{F}$。证明存在 $\deg p=n$ 的 $p\in\mathcal{P}(\mathbf{F})$,使 $0=p(\lambda_1)=\cdots=p(\lambda_m)$,并且 $p$ 没有其它零点。
提示先写出只以 $\lambda_1,\dots,\lambda_m$ 为零点的多项式,再用重复某个因式的办法把次数「补足」到 $n$。
参考解答

令 $p(z)=(z-\lambda_1)^{n-m+1}(z-\lambda_2)\cdots(z-\lambda_m)$。它的次数是 $(n-m+1)+(m-1)=n$。显然每个 $\lambda_j$ 都是零点。反之若 $p(z)=0$,则某个因式 $z-\lambda_j$ 为零(乘积为零 ⟹ 某个因子为零),即 $z=\lambda_j$。所以 $p$ 的零点恰好是 $\lambda_1,\dots,\lambda_m$(即使其中有相同的也没关系)。

4.7(插值多项式)设 $m\ge0$,$z_1,\dots,z_{m+1}\in\mathbf{F}$ 互不相同,$w_1,\dots,w_{m+1}\in\mathbf{F}$。证明存在唯一的 $p\in\mathcal{P}_m(\mathbf{F})$ 使 $p(z_k)=w_k$,$k=1,\dots,m+1$。原书提示:这可以不用线性代数证明,但试着找一个用线性代数的、更清楚更短的证明。
提示考虑线性映射 $T:\mathcal{P}_m(\mathbf{F})\to\mathbf{F}^{m+1}$,$Tp=(p(z_1),\dots,p(z_{m+1}))$。它是单射吗?两边维数各是多少?
参考解答

$T$ 显然是线性的。单射:若 $Tp=0$,则 $p\in\mathcal{P}_m(\mathbf{F})$ 有 $m+1$ 个不同的零点;非零多项式的零点个数不超过它的次数(4.8;非零常数没有零点),所以 $p=0$,即 $\operatorname{null}T=\{0\}$。满射:$\dim\mathcal{P}_m(\mathbf{F})=m+1=\dim\mathbf{F}^{m+1}$,而同维有限维空间之间的线性映射单射 ⟺ 满射 3.65,所以 $T$ 也是满射。于是对 $(w_1,\dots,w_{m+1})$ 存在 $p$ 使 $Tp=(w_1,\dots,w_{m+1})$(存在性),且由单射性它唯一(唯一性)。

4.8设 $p\in\mathcal{P}(\mathbf{C})$ 的次数为 $m$。证明:$p$ 有 $m$ 个不同的零点,当且仅当 $p$ 与它的导数 $p'$ 没有公共零点。
提示「有 $m$ 个不同零点」⟺ 4.13 的分解中没有重复因式。若 $p(z)=(z-\lambda)^2r(z)$,求导看 $p'(\lambda)$;反之若 $p(\lambda)=p'(\lambda)=0$,写 $p=(z-\lambda)q$ 后求导。
参考解答

由 4.13,$p=c(z-\lambda_1)\cdots(z-\lambda_m)$;$p$ 有 $m$ 个不同零点当且仅当这些 $\lambda_j$ 两两不同,即没有因式出现两次。

(若有公共零点 ⟹ 零点不足 $m$ 个)设 $p(\lambda)=p'(\lambda)=0$。由 4.6,$p(z)=(z-\lambda)q(z)$,求导得 $p'(z)=q(z)+(z-\lambda)q'(z)$,所以 $0=p'(\lambda)=q(\lambda)$,再由 4.6,$q(z)=(z-\lambda)q_1(z)$,即 $p(z)=(z-\lambda)^2q_1(z)$。由分解的唯一性,$z-\lambda$ 在 $p$ 的分解中至少出现两次,所以不同的零点至多 $m-1$ 个。

(若零点不足 $m$ 个 ⟹ 有公共零点)则某个 $\lambda$ 重复,$p(z)=(z-\lambda)^2r(z)$,于是 $p'(z)=2(z-\lambda)r(z)+(z-\lambda)^2r'(z)$,$p'(\lambda)=0=p(\lambda)$,$\lambda$ 是公共零点。

4.9证明:每个奇数次的实系数多项式都有实零点。
提示看 4.16 的分解里次数是怎么数的。
参考解答

由 4.16,$p(x)=c(x-\lambda_1)\cdots(x-\lambda_m)(x^2+b_1x+c_1)\cdots(x^2+b_Mx+c_M)$,所以 $\deg p=m+2M$。$\deg p$ 是奇数,而 $2M$ 是偶数,故 $m$ 是奇数,特别地 $m\ge1$,于是 $\lambda_1$ 就是 $p$ 的实零点。(另一种证法:奇数次多项式在 $x\to+\infty$ 与 $x\to-\infty$ 时符号相反,由介值定理必有零点。)

4.11设 $p\in\mathcal{P}(\mathbf{C})$,定义 $q(z)=p(z)\,\overline{p(\bar z)}$。证明 $q$ 是实系数多项式。
提示若 $p(z)=\sum_j a_jz^j$,先说明 $\overline{p(\bar z)}=\sum_j\bar a_jz^j$,再看乘积 $q$ 的第 $n$ 个系数的共轭。
参考解答

设 $p(z)=\sum_{j=0}^m a_jz^j$。由共轭的可加性、可乘性与 $\bar{\bar z}=z$(4.4),$\overline{p(\bar z)}=\sum_j\bar a_j\,\overline{\bar z^{\,j}}=\sum_j\bar a_jz^j$,这是系数取共轭后的多项式。所以 $q(z)=\big(\sum_j a_jz^j\big)\big(\sum_k\bar a_kz^k\big)$ 是多项式,$z^n$ 的系数是 $c_n=\sum_{j+k=n}a_j\bar a_k$。取共轭:$\bar c_n=\sum_{j+k=n}\bar a_ja_k$,把求和指标 $j,k$ 互换,它就是 $\sum_{j+k=n}a_j\bar a_k=c_n$。所以每个 $c_n$ 都是实数。

4.12设 $m\ge0$,$p\in\mathcal{P}_m(\mathbf{C})$,且存在互不相同的实数 $x_0,x_1,\dots,x_m$ 使每个 $p(x_k)\in\mathbf{R}$。证明 $p$ 的系数全是实数。
提示令 $\tilde p$ 为把 $p$ 的系数全部取共轭得到的多项式,考虑 $p-\tilde p$ 有多少个零点。
参考解答

设 $p(z)=\sum_j a_jz^j$,$\tilde p(z)=\sum_j\bar a_jz^j$。对实数 $x$ 有 $\tilde p(x)=\overline{p(x)}$。由于 $p(x_k)$ 是实数,$\tilde p(x_k)=\overline{p(x_k)}=p(x_k)$。于是 $p-\tilde p\in\mathcal{P}_m(\mathbf{C})$ 有 $m+1$ 个不同的零点 $x_0,\dots,x_m$,由 4.8 它是零多项式,即每个 $a_j=\bar a_j$,所以 $a_j$ 是实数。

4.13设 $p\in\mathcal{P}(\mathbf{F})$,$p\ne0$,$U=\{pq:q\in\mathcal{P}(\mathbf{F})\}$($p$ 的全部倍式)。(a) 证明 $\dim\mathcal{P}(\mathbf{F})/U=\deg p$;(b) 求 $\mathcal{P}(\mathbf{F})/U$ 的一组基。(商空间见 3.99。)
提示设 $n=\deg p$。猜测基是 $1+U,\ z+U,\ \dots,\ z^{n-1}+U$。张成:用带余除法;线性无关:次数比较。
参考解答

设 $n=\deg p$(若 $n=0$,$p$ 是非零常数,$U=\mathcal{P}(\mathbf{F})$,商空间为 $\{0\}$,维数 0,结论成立)。断言 $1+U,z+U,\dots,z^{n-1}+U$ 是基。

张成:任给 $f\in\mathcal{P}(\mathbf{F})$,由带余除法 4.9,$f=pq+r$,$\deg r\lt n$。因为 $f-r=pq\in U$,所以 $f+U=r+U$,而 $r+U$ 是 $1+U,\dots,z^{n-1}+U$ 的线性组合(系数就是 $r$ 的系数)。

线性无关:若 $\sum_{k\lt n}a_k(z^k+U)=0+U$,则 $r=\sum_{k\lt n}a_kz^k\in U$,即 $r=pq$。若 $q\ne0$,则 $\deg r=\deg p+\deg q\ge n$,与 $\deg r\le n-1$ 矛盾;所以 $q=0$,$r=0$,所有 $a_k=0$。

于是 $\dim\mathcal{P}(\mathbf{F})/U=n=\deg p$。(直观:模掉 $p$ 的倍式,每个多项式只剩下「除以 $p$ 的余式」,而余式住在 $n$ 维空间 $\mathcal{P}_{n-1}(\mathbf{F})$ 里。)

4.14设 $p,q\in\mathcal{P}(\mathbf{C})$ 都是非常数多项式且没有公共零点,$m=\deg p$,$n=\deg q$。按下面的步骤用线性代数证明:存在 $r\in\mathcal{P}_{n-1}(\mathbf{C})$、$s\in\mathcal{P}_{m-1}(\mathbf{C})$ 使 $rp+sq=1$。(a) 定义 $T:\mathcal{P}_{n-1}(\mathbf{C})\times\mathcal{P}_{m-1}(\mathbf{C})\to\mathcal{P}_{m+n-1}(\mathbf{C})$,$T(r,s)=rp+sq$,证明 $T$ 是单射;(b) 证明 $T$ 是满射;(c) 得出结论。
提示(a) 若 $rp=-sq$,$p$ 的每个一次因式都必须出现在 $s$ 的分解里(因为它不出现在 $q$ 的分解里),而 $\deg s\lt m$。(b) 比较两边维数。
参考解答

(a) 设 $T(r,s)=0$,即 $rp=-sq$。若 $s\ne0$,则 $rp=-sq\ne0$。由 4.13,$p=c(z-\lambda_1)\cdots(z-\lambda_m)$。多项式 $rp$ 在 ℂ 上的分解(唯一)包含 $(z-\lambda_1)\cdots(z-\lambda_m)$ 的全部因式(计重数);同一个多项式 $-sq$ 的分解是 $s$ 的分解与 $q$ 的分解拼起来的。因为 $p,q$ 没有公共零点,$z-\lambda_j$ 都不出现在 $q$ 的分解中,所以它们(计重数)全部出现在 $s$ 的分解中,于是 $\deg s\ge m$,与 $s\in\mathcal{P}_{m-1}(\mathbf{C})$ 矛盾。故 $s=0$,从而 $rp=0$,而 $p\ne0$,所以 $r=0$。$T$ 是单射。

(b) 由 3.92,定义域维数为 $\dim\mathcal{P}_{n-1}(\mathbf{C})+\dim\mathcal{P}_{m-1}(\mathbf{C})=n+m$,等于 $\dim\mathcal{P}_{m+n-1}(\mathbf{C})$。同维空间之间的单射线性映射也是满射 3.65。

(c) 常数多项式 $1\in\mathcal{P}_{m+n-1}(\mathbf{C})$,由满射性存在 $(r,s)$ 使 $rp+sq=T(r,s)=1$。(这和带余除法的证明异曲同工:把一个代数问题变成「某个线性映射是满射」。)

第 5 章

特征值与特征向量 Eigenvalues and Eigenvectors

从这一章起,主角换成「算子」——把空间映回自身的线性映射。我们要找出算子最简单的样子:哪些方向只被拉伸、不被转向?能不能换一组基,让它的矩阵变成上三角、甚至对角?

学习目标
  • 看懂不变子空间与特征向量:特征向量张成的直线,就是被算子「映回自身」的一维子空间
  • 会把多项式代入算子得到 $p(T)$,理解极小多项式,并能用 $v, Tv, T^2v,\dots$ 把它算出来
  • 掌握本章的枢纽定理「特征值 = 极小多项式的零点」,并用它判断可逆、能否上三角化、能否对角化
  • 明白为什么 ℂ 上每个算子都有特征值、都能上三角化,而 ℝ 上不一定(奇数维除外)
  • 会用 Gershgorin 圆盘估计特征值的位置;理解可交换算子为什么能用同一组基同时化简
一分钟速览
  • 特征向量是被算子「只拉伸、不转向」的非零向量:$Tv=\lambda v$。它张成的直线正是一维不变子空间;伸缩倍数 $\lambda$ 叫特征值。
  • 把多项式代入算子得到 $p(T)$。使 $p(T)=0$ 的次数最低的首一多项式叫极小多项式,它的次数不超过 $\dim V$。
  • 枢纽定理 5.27:特征值恰好是极小多项式的零点。于是由代数基本定理,ℂ 上的算子必有特征值 5.19;ℝ 上奇数维的算子也必有 5.34。
  • 上三角矩阵的对角线恰好列出全部特征值。能上三角化 ⇔ 极小多项式是一次因式之积 5.44;在 ℂ 上总能做到 5.47。
  • 可对角化 ⇔ 存在由特征向量组成的基 ⇔ 极小多项式是互不相同的一次因式之积 5.55 5.62。对角化后算子就是「沿几个方向各自伸缩」,$T^{100}$ 也能一眼算出。
  • Gershgorin 圆盘:每个特征值都落在某个「以对角元为圆心、同一行其余元素绝对值之和为半径」的圆盘里 5.67。
  • 可交换($ST=TS$)的算子共享特征向量:可对角化时能同时对角化 5.76,在 ℂ 上能同时上三角化 5.80。
本章地图 5A 不变子空间T 把 U 映回 U 特征值 · 特征向量Tv = λv(5.5) 多项式作用于算子p(T)(5.14) 5B 特征值存在ℂ 上必有(5.19) Gershgorin 圆盘圈住特征值(5.67) 5B 极小多项式最短的 p(T)=0 特征值 = 零点枢纽定理(5.27) ℝ 上奇数维必有特征值(5.34) 5C 上三角化一次因式之积(5.44) 5D 可对角化因式互不相同(5.62) 5E 可交换算子同时对角化(5.76) 箭头:用到 / 推出 点击方框跳到对应小节
本章约定 standing assumptions for this chapter
  • $\mathbf{F}$ 表示 $\mathbf{R}$ 或 $\mathbf{C}$;$V$ 表示 $\mathbf{F}$ 上的向量空间。
  • 凡是用到「维数」的结果,都会注明「设 $V$ 有限维」;有的结论只对 $\mathbf{F}=\mathbf{C}$ 或只对 $\mathbf{F}=\mathbf{R}$ 成立,届时会特别指出——本章很多结论都和 𝐅 是 ℝ 还是 ℂ 有关,这是读本章时最需要留心的地方。

原书第 5 章开篇配有斐波那契(Leonardo of Pisa)的雕像:习题 5D.21 会用本章的「对角化」求出斐波那契数列的通项公式(本章习题里有完整解答)。

5A 不变子空间 Invariant Subspaces

这一节要解决的问题:研究一个算子时,能不能把空间拆成小块、各个击破?能拆的前提是每一小块都被算子「映回自己」——这就是不变子空间。而最小的不变子空间(一维的)恰好对应着本章的主角:特征向量与特征值。

特征值 Eigenvalues

定义算子operator5.1

从向量空间到它自身的线性映射称为算子。记号 $\mathcal{L}(V)$ 表示 $\mathcal{L}(V,V)$,即 $V$ 上全体算子。

第 3 章研究的是一般的线性映射 $V\to W$;从现在起我们只关心 $V\to V$。原书开篇说:对算子的研究构成了线性代数最重要的部分。为什么「映回自身」这么要紧?因为只有这样,才能把 $T$ 反复作用($T^2, T^3,\dots$),才能谈「某个方向被 $T$ 保持不变」。

分而治之的想法。假设 $V=V_1\oplus\cdots\oplus V_m$($m\ge 2$,每个 $V_k$ 非零)。要理解 $T$,只需理解它在每一小块上的限制(restriction) $T|_{V_k}$——小块的维数更低,自然更容易。但有个麻烦:$T|_{V_k}$ 可能把 $V_k$ 里的向量送出 $V_k$,那它就不是 $V_k$ 上的算子了,没法再求幂、再分析。所以我们只要那些「被 $T$ 映回自身」的子空间:

同一个算子 T(x, y) = (2x + y, y),两条直线的命运不同 u Tu u′ Tu′ U = x 轴 Tu 仍在 U 上 ⇒ U 是不变子空间 ✓ u Tu u′ Tu′ U = y 轴 Tu 跑出了 U ⇒ 不是不变子空间 ✗
示意图(本教材绘制):x 轴上的向量被 T 拉长 2 倍后仍在 x 轴上;y 轴上的向量却被推离了 y 轴。
定义不变子空间invariant subspace5.2

设 $T\in\mathcal{L}(V)$。$V$ 的子空间 $U$ 称为在 $T$ 下不变,如果对每个 $u\in U$ 都有 $Tu\in U$。

换句话说:$U$ 在 $T$ 下不变 ⇔ 限制 $T|_U$ 是 $U$ 上的一个算子。

直觉 不变子空间像一个「封闭的房间」:从房间里任何一点出发,被 $T$ 推一下,还落在房间里。把 $V$ 拆成几个这样的房间,$T$ 就被拆成了几个互不干扰的小算子。
例求导算子的不变子空间5.3

$T\in\mathcal{L}(\mathcal{P}(\mathbf{R}))$,$Tp=p'$。次数 ≤ 4 的多项式求导后次数仍 ≤ 4,所以 $\mathcal{P}_4(\mathbf{R})$ 在 $T$ 下不变。

例四个(未必不同的)不变子空间5.4

对任意 $T\in\mathcal{L}(V)$,下面四个子空间都不变:$\{0\}$;$V$;$\operatorname{null} T$($Tu=0\in\operatorname{null}T$);$\operatorname{range} T$($Tu$ 当然在值域里)。

那么,一个算子是否一定有 $\{0\}$ 和 $V$ 之外的不变子空间?$\operatorname{null}T$ 与 $\operatorname{range}T$ 帮不上忙——$T$ 可逆时它们恰好就是 $\{0\}$ 和 $V$。答案要等到后面:若 $V$ 有限维且 $\dim V\gt 1$(𝐅 = ℂ)或 $\dim V\gt 2$(𝐅 = ℝ),答案是肯定的(见 5.19 和习题 5B.29)。

先看最简单的:一维不变子空间。任取 $v\ne 0$,$U=\operatorname{span}(v)=\{\lambda v:\lambda\in\mathbf{F}\}$ 是一条过原点的直线(每个一维子空间都长这样)。$U$ 在 $T$ 下不变,意味着 $Tv\in U$,也就是存在数 $\lambda$ 使

$$Tv=\lambda v .$$

反过来,若 $Tv=\lambda v$,则 $\operatorname{span}(v)$ 就是一维不变子空间。这个方程太重要了,于是它里面的 $\lambda$ 和 $v$ 都有了专门的名字。

定义特征值eigenvalue5.5

设 $T\in\mathcal{L}(V)$。数 $\lambda\in\mathbf{F}$ 称为 $T$ 的特征值,如果存在 $v\in V$,$v\ne 0$,使 $Tv=\lambda v$。

两点说明
  • 必须要求 $v\ne 0$:因为 $T0=\lambda 0$ 对每个 $\lambda$ 都成立,不加限制的话每个数都成了特征值。
  • eigenvalue 是半德语半英语的词,德语前缀 eigen 意为「自己的、固有的」——特征值刻画的是算子「自身固有」的性质。
由上面的讨论:$V$ 有一维不变子空间 ⇔ $T$ 有特征值。
例一个特征值5.6

$T\in\mathcal{L}(\mathbf{F}^3)$,$T(x,y,z)=(7x+3z,\ 3x+6y+9z,\ -6y)$。验算 $T(3,1,-1)=(18,6,-6)=6\,(3,1,-1)$,所以 6 是 $T$ 的特征值。(想知道它还有没有别的特征值?下一节的「极小多项式计算器」里选这个例子试试。)

定理特征值的等价条件equivalent conditions to be an eigenvalue5.7

设 $V$ 有限维,$T\in\mathcal{L}(V)$,$\lambda\in\mathbf{F}$。下列条件等价:

(a) $\lambda$ 是 $T$ 的特征值;(b) $T-\lambda I$ 不是单射;(c) $T-\lambda I$ 不是满射;(d) $T-\lambda I$ 不可逆。

证明思路

$Tv=\lambda v$ 与 $(T-\lambda I)v=0$ 是同一个方程,所以「有非零解」⇔ $T-\lambda I$ 的零空间非零 ⇔ 不是单射,(a)⇔(b)。有限维空间上的算子「单射 ⇔ 满射 ⇔ 可逆」(原书 3.65),得 (b)(c)(d) 等价。

这给了我们一个非常实用的视角:λ 是特征值,当且仅当 $T-\lambda I$ 会把某个非零向量「压扁」成 0。

定义特征向量eigenvector5.8

设 $T\in\mathcal{L}(V)$,$\lambda$ 是 $T$ 的特征值。向量 $v\in V$ 称为 $T$ 的对应于 $\lambda$ 的特征向量,如果 $v\ne 0$ 且 $Tv=\lambda v$。

等价地:非零向量 $v$ 是特征向量 ⇔ $Tv$ 是 $v$ 的倍数 ⇔ $v\in\operatorname{null}(T-\lambda I)$。

特征方向猎人:拖动 v,让 Tv 与 v 共线

左图:拖动蓝色向量 $v$(它在一个圆上转动),红色箭头是 $Tv$;蓝色虚线是直线 span(v),红色虚线是它的像 span(Tv)。右图横轴是 $v$ 的方向角 θ,纵轴是「span(Tv) 相对 span(v) 转过的角度」。纵坐标为 0 ⇔ 两条直线重合 ⇔ $v$ 是特征向量。先自己找,再勾选「显示答案」核对;也可以点「自动扫描」。

右图曲线穿过 0 的地方就是特征方向:此时 $Tv$ 恰好落在直线 span(v) 上,这条直线就是一维不变子空间,$Tv$ 与 $v$ 的长度比(带符号)就是特征值。对称矩阵有两条互相垂直的特征直线;剪切只有一条(曲线只「碰」到 0 一次);旋转 90° 的曲线始终停在 90°——ℝ² 中没有任何直线被它保持,所以它没有实特征值;数乘 $2I$ 则让每条直线都不变。

例旋转算子:在 ℝ 上没有、在 ℂ 上有特征值5.9

$T\in\mathcal{L}(\mathbf{F}^2)$,$T(w,z)=(-z,w)$。

(a) 𝐅 = ℝ:$T$ 是绕原点逆时针旋转 90°。一个非零向量转 90° 后不可能是它自己的倍数,所以 $T$ 没有特征值(也就没有特征向量)。上面的演示选「旋转 90°」就能看到这一点。

(b) 𝐅 = ℂ:解 $T(w,z)=\lambda(w,z)$,即方程组 5.10:$-z=\lambda w,\ w=\lambda z$。把第二式代入第一式得 $-z=\lambda^2 z$;$z\ne 0$(否则 $w=0$),故 $\lambda^2=-1$,$\lambda=\pm i$。对应于 $i$ 的特征向量是 $(w,-wi)$,对应于 $-i$ 的是 $(w,wi)$($w\in\mathbf{C}$,$w\ne 0$)。

常见误区:特征值与 𝐅 无关? 同一个公式定义的算子,在 ℝ 上可能一个特征值都没有,在 ℂ 上却有两个。特征值必须是 𝐅 中的数——𝐅 = ℝ 时,$\pm i$ 根本不在「候选名单」里。本章会反复遇到这种 ℝ/ℂ 之别。
定理不同特征值的特征向量线性无关linearly independent eigenvectors5.11

设 $T\in\mathcal{L}(V)$。对应于 $T$ 的互不相同的特征值的特征向量组成的组,总是线性无关的。

证明思路

核心想法:用 $T-\lambda_m I$ 「消去」最后一个向量,同时保留其余向量(系数只是乘上了非零数 $\lambda_k-\lambda_m$)。

反设结论不成立,取最短的线性相关组 $v_1,\dots,v_m$(对应互异的 $\lambda_1,\dots,\lambda_m$,$m\ge 2$),则有全不为 0 的 $a_k$ 使 $a_1v_1+\cdots+a_mv_m=0$。两边作用 $T-\lambda_mI$:$(T-\lambda_mI)v_k=(\lambda_k-\lambda_m)v_k$,于是 $a_1(\lambda_1-\lambda_m)v_1+\cdots+a_{m-1}(\lambda_{m-1}-\lambda_m)v_{m-1}=0$,系数都不为 0——得到更短的相关组,矛盾。

直觉 一条过原点的直线上,$T$ 只能有一个伸缩倍数。所以两个伸缩倍数不同的特征向量不可能在同一条直线上;更一般地,不同的伸缩倍数把它们彼此「拉开」,谁也不能由别人线性组合出来。
定理特征值个数不超过维数operator cannot have more eigenvalues than dimension of vector space5.12

设 $V$ 有限维,则 $V$ 上每个算子至多有 $\dim V$ 个互不相同的特征值。

证明思路

每个特征值取一个特征向量;由 5.11 它们线性无关,而 $V$ 中线性无关组的长度不超过 $\dim V$(原书 2.22)。

设 $V$ 有限维。下列哪一条不等价于「3 是 $T$ 的特征值」?

多项式作用于算子 Polynomials Applied to Operators

算子比一般线性映射有更丰富的理论,主要原因只有一个:算子可以自乘。$T:V\to V$ 能和自己复合,得到 $T^2=TT$、$T^3$……进而可以把整个多项式「代入」算子。这是下一节证明「ℂ 上的算子必有特征值」的关键工具。

定义算子的幂notation: Tm5.13

$T^m=\underbrace{T\cdots T}_{m\text{ 个}}$;$T^0=I$;$T$ 可逆时 $T^{-m}=(T^{-1})^m$。熟悉的指数律成立:$T^mT^n=T^{m+n}$,$(T^m)^n=T^{mn}$。

定义多项式作用于算子notation: p(T)5.14

若 $p(z)=a_0+a_1z+\cdots+a_mz^m$,则 $p(T)$ 是 $V$ 上的算子 $$p(T)=a_0I+a_1T+a_2T^2+\cdots+a_mT^m .$$

做法就是「把 $z$ 换成 $T$」。注意常数项 $a_0$ 变成了 $a_0I$:因为 $a_0=a_0z^0$,而 $T^0=I$。固定 $T$ 后,映射 $p\mapsto p(T)$ 是从 $\mathcal{P}(\mathbf{F})$ 到 $\mathcal{L}(V)$ 的线性映射。

例多项式作用于求导算子5.15

$D\in\mathcal{L}(\mathcal{P}(\mathbf{R}))$,$Dq=q'$;$p(x)=7-3x+5x^2$。则 $p(D)=7I-3D+5D^2$,即 $\big(p(D)\big)q=7q-3q'+5q''$。

定义多项式的乘积product of polynomials5.16

$(pq)(z)=p(z)q(z)$。

定理乘法性质multiplicative properties5.17

设 $p,q\in\mathcal{P}(\mathbf{F})$,$T\in\mathcal{L}(V)$,则 (a) $(pq)(T)=p(T)q(T)$;(b) $p(T)q(T)=q(T)p(T)$。

证明思路

原书页边注的「非正式证明」一语中的:用分配律把乘积展开时,符号是 $z$ 还是 $T$ 无关紧要——$\sum_j a_jT^j\cdot\sum_k b_kT^k=\sum_{j,k}a_jb_kT^{j+k}$,正是 $pq$ 代入 $T$。(b) 由 (a) 和 $pq=qp$ 立得。

常见误区 一般的两个算子 $S,T$ 不满足 $ST=TS$;但同一个算子的两个多项式一定可交换。这就是为什么后面可以随意调换 $(T-\lambda_1I)(T-\lambda_2I)\cdots$ 中各因子的顺序。
定理$p(T)$ 的零空间与值域在 $T$ 下不变null space and range of p(T) are invariant under T5.18

设 $T\in\mathcal{L}(V)$,$p\in\mathcal{P}(\mathbf{F})$。则 $\operatorname{null}p(T)$ 与 $\operatorname{range}p(T)$ 都在 $T$ 下不变。

证明思路

关键是 $p(T)$ 与 $T$ 可交换(5.17,取 $q(z)=z$)。若 $p(T)u=0$,则 $p(T)(Tu)=T\big(p(T)u\big)=T0=0$;若 $u=p(T)v$,则 $Tu=p(T)(Tv)\in\operatorname{range}p(T)$。

这是一台「不变子空间制造机」:随便挑一个多项式 $p$,就得到两个不变子空间。5.4 中的 $\operatorname{null}T$、$\operatorname{range}T$ 只是 $p(z)=z$ 的特例。后面的很多证明(5.22、5.34、5.44、5.62)都靠它把问题缩小到一个更小的不变子空间上。

一个贯穿全章的小事实 若 $Tv=\lambda v$,则 $T^kv=\lambda^kv$,从而对任意多项式 $p$ 有 $$p(T)v=p(\lambda)v .$$ 也就是说:在特征向量上,把算子 $T$ 换成数 $\lambda$ 就行。例如 $T=\begin{pmatrix}2 & 0\\ 0 & 3\end{pmatrix}$,$p(z)=z^2-5z+6=(z-2)(z-3)$:$p(T)$ 在 $e_1$ 上等于 $p(2)=0$,在 $e_2$ 上等于 $p(3)=0$,所以 $p(T)=0$——一个多项式把整个算子「消灭」了。这正是下一节「极小多项式」的起点。

$v$ 是 $T$ 对应于特征值 $\lambda=2$ 的特征向量。$(T^3-4T+I)v$ 等于多少?

本节要点
  • 不变子空间 = 被 $T$ 映回自身的子空间;只有在不变子空间上,限制 $T|_U$ 才是算子。
  • 一维不变子空间 ⇔ 特征向量:$Tv=\lambda v$,$v\ne 0$。有限维时,$\lambda$ 是特征值 ⇔ $T-\lambda I$ 不可逆。
  • 不同特征值的特征向量线性无关,所以特征值至多 $\dim V$ 个。
  • $p(T)$:把多项式代入算子;同一 $T$ 的多项式彼此可交换;$\operatorname{null}p(T)$、$\operatorname{range}p(T)$ 都是不变子空间;在特征向量上 $p(T)v=p(\lambda)v$。
算子operator从向量空间到它自身的线性映射;$\mathcal{L}(V)=\mathcal{L}(V,V)$。
不变子空间invariant subspace子空间 $U$ 满足:$u\in U\Rightarrow Tu\in U$。
限制算子restriction operator$U$ 不变时,$T|_U$ 是把 $T$ 只作用在 $U$ 上得到的 $U$ 上的算子。
特征值eigenvalue数 $\lambda$,使存在 $v\ne 0$ 满足 $Tv=\lambda v$;等价于 $T-\lambda I$ 不可逆(有限维)。
特征向量eigenvector非零向量 $v$ 满足 $Tv=\lambda v$:被 $T$ 只伸缩、不转向。
多项式作用于算子p(T), polynomial applied to an operator$p(z)=\sum a_kz^k$ 时 $p(T)=\sum a_kT^k$,常数项变成 $a_0I$。

5B 极小多项式 The Minimal Polynomial

这一节要解决的问题:算子一定有特征值吗?怎样把它们找出来?答案都藏在一个多项式里——极小多项式,也就是「能把 $T$ 变成零算子的最短多项式」。本节的枢纽结论是:特征值恰好是极小多项式的零点。

复向量空间上特征值的存在性 Existence of Eigenvalues on Complex Vector Spaces

定理特征值的存在性existence of eigenvalues5.19

有限维非零复向量空间上的每个算子都有特征值。

证明(原书的证明,不用行列式)

设 $\dim V=n\gt 0$,任取 $v\ne 0$。$v,Tv,T^2v,\dots,T^nv$ 共 $n+1$ 个向量,必线性相关,于是存在次数最低的非常数多项式 $p$ 使 $p(T)v=0$。由代数基本定理(原书 4.12),$p$ 有根 $\lambda\in\mathbf{C}$,从而 $p(z)=(z-\lambda)q(z)$(原书 4.6)。由 5.17, $$0=p(T)v=(T-\lambda I)\big(q(T)v\big).$$ $q$ 的次数比 $p$ 低,由 $p$ 的最小性,$q(T)v\ne 0$。所以 $\lambda$ 是特征值,$q(T)v$ 是对应的特征向量。

这个证明短小而漂亮:只用到「向量太多必相关」和「复系数多项式必有根」。下面用一个 ℝ² 中能画出来的例子,把每一步看清楚(这里恰好多项式在 ℝ 上就能分解,所以能画在平面上)。

第 1 步:任取一个非零向量 $v$

算子取 $T(x,y)=(2x+y,\ x+2y)$,取 $v=(1,0)$。证明并不挑剔 $v$——任何非零向量都行。

第 2 步:反复作用 $T$,向量「太多」必相关

$Tv=(2,1)$,$T^2v=(5,4)$。在 2 维空间里,$v,Tv,T^2v$ 这 3 个向量必然线性相关(一般地,$n$ 维空间里 $v,Tv,\dots,T^nv$ 有 $n+1$ 个)。

第 3 步:相关关系就是一个多项式

可以验证 $3v-4Tv+T^2v=0$:图中三段箭头首尾相接,回到了原点。把它写成 $p(T)v=0$,其中 $p(z)=z^2-4z+3$。($v,Tv$ 不共线,所以没有更低次的多项式能做到,$p$ 的次数已是最低。)

第 4 步:把多项式分解——这里要用代数基本定理

$p(z)=(z-3)(z-1)$,于是 $0=p(T)v=(T-3I)\,\big[(T-I)v\big]$。令 $w=(T-I)v=Tv-v=(1,1)$。因为 $z-1$ 的次数比 $p$ 低,$w$ 不可能是 0。

第 5 步:$w$ 就是特征向量

$(T-3I)w=0$,即 $Tw=3w$:$T(1,1)=(3,3)$。特征值 3 找到了!若改用另一个根 1,则 $w'=(T-3I)v=(-1,1)$ 满足 $Tw'=w'$。在 ℂ 上,第 4 步总能做到;在 ℝ 上,$p$ 可能是 $z^2+1$ 这种没有实根的多项式(例 5.9 的旋转),证明就卡住了。

直觉:为什么偏偏需要 ℂ 证明里唯一「非线性代数」的一步是:多项式 $p$ 有根。ℂ 上这由代数基本定理保证;ℝ 上则不然。可以说「ℂ 上每个算子都有特征值」与「ℂ 上每个多项式都有根」几乎是同一件事的两面(习题 5B.16 说明每个首一多项式都是某个算子的极小多项式)。
例复向量空间上没有特征值的算子5.20

$T\in\mathcal{L}(\mathcal{P}(\mathbf{C}))$,$(Tp)(z)=zp(z)$。对非零多项式 $p$,$Tp$ 的次数比 $p$ 高 1,不可能是 $p$ 的倍数,所以 $T$ 没有特征值。这与 5.19 不矛盾:$\mathcal{P}(\mathbf{C})$ 是无限维的。5.19 的「有限维」「复」两个条件都去不掉(去掉「复」的反例是例 5.9)。

特征值与极小多项式 Eigenvalues and the Minimal Polynomial

定义首一多项式monic polynomial5.21

最高次项系数为 1 的多项式称为首一多项式。例如 $2+9z^2+z^7$ 是 7 次首一多项式。

先用一个粗糙的论证预热。$\mathcal{L}(V)$ 本身是 $n^2$ 维的向量空间($n=\dim V$),所以 $I,T,T^2,\dots,T^{n^2}$ 这 $n^2+1$ 个算子必线性相关——某个非零多项式代入 $T$ 后等于 0。下面的定理把次数上界从 $n^2$ 大幅改进到 $n$。

定理极小多项式的存在性、唯一性与次数existence, uniqueness, and degree of minimal polynomial5.22

设 $V$ 有限维,$T\in\mathcal{L}(V)$。则存在唯一一个次数最低的首一多项式 $p\in\mathcal{P}(\mathbf{F})$ 使 $p(T)=0$;并且 $\deg p\le\dim V$。

证明思路(对维数归纳)

存在且 $\deg\le\dim V$。$\dim V=0$ 时取 $p=1$。一般情形:取 $u\ne 0$,由线性相关性引理(原书 2.19),有最小的 $m\le\dim V$ 使 $T^mu$ 是 $u,Tu,\dots,T^{m-1}u$ 的线性组合: $$c_0u+c_1Tu+\cdots+c_{m-1}T^{m-1}u+T^mu=0 .\qquad(5.23)$$ 令 $q(z)=c_0+c_1z+\cdots+c_{m-1}z^{m-1}+z^m$,则 $q(T)u=0$,进而 $q(T)(T^ku)=T^k\big(q(T)u\big)=0$。而 $u,Tu,\dots,T^{m-1}u$ 线性无关,所以 $\dim\operatorname{null}q(T)\ge m$,$\dim\operatorname{range}q(T)\le\dim V-m$。$\operatorname{range}q(T)$ 在 $T$ 下不变(5.18),对 $T|_{\operatorname{range}q(T)}$ 用归纳假设,得首一的 $s$,$\deg s\le\dim V-m$,$s$ 在 $\operatorname{range}q(T)$ 上把 $T$ 变成 0。于是 $(sq)(T)v=s(T)\big(q(T)v\big)=0$ 对所有 $v$ 成立,$sq$ 首一且次数 $\le\dim V$。

唯一。若 $p,r$ 都是次数最低的首一多项式且 $p(T)=r(T)=0$,则 $(p-r)(T)=0$ 且 $\deg(p-r)\lt\deg p$(首项抵消)。若 $p-r\ne 0$,除以它的首项系数就得到次数更低、仍能消灭 $T$ 的首一多项式,矛盾。

定义极小多项式minimal polynomial5.24

设 $V$ 有限维,$T\in\mathcal{L}(V)$。$T$ 的极小多项式是使 $p(T)=0$ 的那个唯一的、次数最低的首一多项式 $p$。

怎样算?原书给了两种办法:

  • 按定义:依次试 $m=1,2,\dots$,看方程 $$c_0I+c_1T+\cdots+c_{m-1}T^{m-1}=-T^m$$ 有没有解。取定基后这是关于 $c_0,\dots,c_{m-1}$ 的 $(\dim V)^2$ 个线性方程;第一次有解的 $m$ 就给出极小多项式 $c_0+c_1z+\cdots+c_{m-1}z^{m-1}+z^m$(5.22 保证 $m\le\dim V$)。
  • 更快的办法 5.25:取一个 $v\ne 0$,解
    $$c_0v+c_1Tv+\cdots+c_{n-1}T^{n-1}v=-T^{n}v\qquad(n=\dim V).$$
    这只是 $n$ 个方程、$n$ 个未知数。若解唯一(绝大多数情况如此),则 $c_0,\dots,c_{n-1},1$ 就是极小多项式的系数。原书页边注:取 $v=(1,0,0,0)$ 时,这个办法对元素取自 $[-10,10]$ 的 4×4 整数矩阵成功率超过 99.8%,取自 $[-100,100]$ 时超过 99.999%。
极小多项式计算器:v, Tv, T²v, … 何时第一次线性相关?

选一个原书中的例子(或直接改矩阵元素),点「下一步」逐个算出 $v,Tv,T^2v,\dots$,直到新向量能由前面的向量线性表出——这就得到首一多项式 $p_v$,使 $p_v(T)v=0$。接着检验 $p_v(T)$ 是否整个为 0;若不是,就改用「按定义」的办法。全部运算用精确分数完成。下方复平面图标出极小多项式的零点;切换 𝐅 = ℝ / ℂ 看结论如何变化。

矩阵 $\mathcal{M}(T)$(标准基,可编辑整数)

多数情况下,$v,Tv,\dots$ 要到第 $\dim V+1$ 个才相关,得到的 $p_v$ 就是极小多项式(例 5.26)。但若 $v$ 恰好「太特殊」——例如例 5.49 中 $v=e_1$ 本身就是特征向量——$p_v$ 只消灭了 $v$,没有消灭整个 $T$,这时就要换 $v$ 或按定义计算。再观察:极小多项式有常数项 0 ⇔ 算子不可逆;复平面上不在实轴上的零点,在 𝐅 = ℝ 时不算特征值。

例𝐅⁵ 上一个算子的极小多项式5.26

设 $T\in\mathcal{L}(\mathbf{F}^5)$ 关于标准基的矩阵为 $$\mathcal{M}(T)=\begin{pmatrix}0 & 0 & 0 & 0 & -3\\ 1 & 0 & 0 & 0 & 6\\ 0 & 1 & 0 & 0 & 0\\ 0 & 0 & 1 & 0 & 0\\ 0 & 0 & 0 & 1 & 0\end{pmatrix}.$$ 取 $v=e_1$:$Te_1=e_2$,$T^2e_1=e_3$,$T^3e_1=e_4$,$T^4e_1=e_5$,$T^5e_1=Te_5=-3e_1+6e_2$。于是 $3e_1-6Te_1=-T^5e_1$。由于 $e_1,Te_1,\dots,T^4e_1$ 就是 $e_1,\dots,e_5$,线性无关,没有别的组合能等于 $-T^5e_1$。所以极小多项式是 $3-6z+z^5$。(上面的计算器选「例 5.26/5.28」可以一步步看到。)

下面是本章的枢纽定理。注意:按定义,特征值与多项式的零点都必须在 𝐅 中——𝐅 = ℝ 时它们都必须是实数。

定理特征值是极小多项式的零点eigenvalues are the zeros of the minimal polynomial5.27

设 $V$ 有限维,$T\in\mathcal{L}(V)$。

(a) $T$ 的极小多项式的零点恰好就是 $T$ 的特征值。

(b) 若 $V$ 是复向量空间,则 $T$ 的极小多项式形如 $$(z-\lambda_1)\cdots(z-\lambda_m),$$ 其中 $\lambda_1,\dots,\lambda_m$ 列出了 $T$ 的全部特征值(可能有重复)。

证明思路

零点 ⇒ 特征值:若 $p(\lambda)=0$,写 $p(z)=(z-\lambda)q(z)$,$q$ 首一且次数少 1。因为 $p$ 是「最短的」,$q(T)\ne 0$,取 $v$ 使 $q(T)v\ne 0$;而 $0=p(T)v=(T-\lambda I)\big(q(T)v\big)$,所以 $q(T)v$ 是对应于 $\lambda$ 的特征向量。(和 5.19 的证明如出一辙。)

特征值 ⇒ 零点:若 $Tv=\lambda v$,$v\ne 0$,则 $0=p(T)v=p(\lambda)v$(上一节的小事实),故 $p(\lambda)=0$。

(b) 由 (a) 和 ℂ 上多项式的因式分解(代数基本定理第二版本,原书 4.13)立得。

直觉:极小多项式是算子的「指纹」 「$p(T)=0$」可以逐个方向地理解:在对应 $\lambda$ 的特征向量上,$p(T)$ 就是乘以数 $p(\lambda)$。要让 $p(T)$ 处处为 0,$p$ 至少得在每个特征值处为 0——所以每个特征值都是零点;而极小多项式「一点不浪费」,它没有多余的零点。由于非零多项式的零点个数不超过次数(原书 4.8),这又给出了 5.12 的另一个证明:特征值至多 $\dim V$ 个。

习题 5B.16 说明:每个首一多项式都是某个算子的极小多项式(它的「友矩阵」companion matrix,正是例 5.26 那种形状)。因此,精确求出任意算子的特征值,等价于精确求出任意多项式的根——而 5 次及以上的多项式没有求根公式。

例一个特征值无法精确求出的算子5.28

$T\in\mathcal{L}(\mathbf{C}^5)$,$T(z_1,z_2,z_3,z_4,z_5)=(-3z_5,\ z_1+6z_5,\ z_2,\ z_3,\ z_4)$。它的矩阵就是例 5.26 中那个,极小多项式是 $3-6z+z^5$。这个多项式的零点无法用有理数、有理数的方根和四则运算表示出来,所以 $T$ 的特征值没有任何熟悉形式的精确表达式。数值计算给出它们约为 $$-1.67,\quad 0.51,\quad 1.40,\quad -0.12+1.59i,\quad -0.12-1.59i .$$ 两个非实的零点互为共轭——实系数多项式理应如此(原书 4.14)。

定理$q(T)=0$ ⇔ $q$ 是极小多项式的倍式q(T) = 0 ⟺ q is a polynomial multiple of the minimal polynomial5.29

设 $V$ 有限维,$T\in\mathcal{L}(V)$,$q\in\mathcal{P}(\mathbf{F})$。则 $q(T)=0$ 当且仅当 $q$ 是 $T$ 的极小多项式 $p$ 的多项式倍式(即 $q=ps$)。

证明思路

「⇐」显然:$q(T)=p(T)s(T)=0$。「⇒」用带余除法(原书 4.9):$q=ps+r$,$\deg r\lt\deg p$ 5.30。代入 $T$ 得 $0=q(T)=p(T)s(T)+r(T)=r(T)$。若 $r\ne 0$,把它变成首一的就得到比 $p$ 更短、仍能消灭 $T$ 的多项式,矛盾。所以 $r=0$。

换句话说,所有「能消灭 $T$ 的多项式」恰好是极小多项式的倍式——极小多项式是它们的「公共因子」。这个结论马上有两个推论:

定理限制算子的极小多项式minimal polynomial of a restriction operator5.31

设 $V$ 有限维,$U$ 是 $T$ 的不变子空间。则 $T$ 的极小多项式是 $T|_U$ 的极小多项式的倍式。

证明思路

$T$ 的极小多项式 $p$ 满足 $p(T)u=0$ 对所有 $u\in U$,即 $p(T|_U)=0$;再对 $T|_U$ 用 5.29。

定理$T$ 不可逆 ⇔ 极小多项式常数项为 0T not invertible ⟺ constant term of minimal polynomial of T is 05.32

设 $V$ 有限维,$T\in\mathcal{L}(V)$。则 $T$ 不可逆当且仅当 $T$ 的极小多项式的常数项为 0。

证明思路

一串等价:$T$ 不可逆 ⇔ 0 是特征值(5.7)⇔ 0 是极小多项式 $p$ 的零点(5.27)⇔ $p(0)=0$ ⇔ 常数项为 0。

$T$ 的极小多项式是 $z^2(z-3)$。下列说法哪个正确?

奇数维实向量空间上的特征值 Eigenvalues on Odd-Dimensional Real Vector Spaces

ℝ 上的算子可能没有特征值(例 5.9 的旋转)。但原书证明了一个漂亮的事实:奇数维的实向量空间上,每个算子都有特征值。直观例子:三维空间里任何一个旋转都有一根「转轴」——转轴上的向量不动,就是特征值 1 的特征向量。关键工具是下面这个「偶数维」引理。

定理偶数维的零空间even-dimensional null space5.33

设 $\mathbf{F}=\mathbf{R}$,$V$ 有限维,$T\in\mathcal{L}(V)$,$b,c\in\mathbf{R}$ 且 $b^2\lt 4c$。则 $\dim\operatorname{null}(T^2+bT+cI)$ 是偶数。

证明思路

把 $V$ 换成不变子空间 $\operatorname{null}(T^2+bT+cI)$(5.18),可设 $T^2+bT+cI=0$,要证 $\dim V$ 为偶数。

① $T$ 没有特征向量:若 $Tv=\lambda v$($\lambda$ 实),则 $0=(\lambda^2+b\lambda+c)v=\big((\lambda+\tfrac{b}{2})^2+c-\tfrac{b^2}{4}\big)v$,括号里是正数,故 $v=0$。

② 取 $U$ 为维数最大的偶数维不变子空间。若 $U\ne V$,取 $w\notin U$,令 $W=\operatorname{span}(w,Tw)$:因为 $T(Tw)=-bTw-cw$,$W$ 不变;因为 $w$ 不是特征向量,$\dim W=2$;因为没有一维不变子空间,$U\cap W=\{0\}$。于是 $U+W$ 是更大的偶数维不变子空间,矛盾。所以 $U=V$,$\dim V$ 为偶数。

直观地说:$z^2+bz+c$($b^2\lt 4c$)没有实根,对应的是一对共轭复特征值;在实空间里它们表现为一个个二维的「旋转平面」 $\operatorname{span}(w,Tw)$,所以只能成双成对地占据维数。

定理奇数维向量空间上的算子有特征值operators on odd-dimensional vector spaces have eigenvalues5.34

奇数维向量空间上的每个算子都有特征值。

证明思路(每次把维数减少一个偶数)

𝐅 = ℂ 时已由 5.19 得到,只需看 𝐅 = ℝ,对奇数 $n=\dim V$ 以步长 2 归纳;$n=1$ 显然。设 $p$ 是极小多项式。若 $p$ 有实的一次因式 $x-\lambda$,则 $\lambda$ 就是特征值(5.27)。否则由实多项式的分解(原书 4.16),$p=q\cdot(x^2+bx+c)$,$b^2\lt 4c$。于是 $q(T)$ 在 $\operatorname{range}(T^2+bT+cI)$ 上为 0;$q$ 比 $p$ 短,所以这个值域 $\ne V$。由线性映射基本定理,$\dim V=\dim\operatorname{null}+\dim\operatorname{range}$,前者为偶数(5.33)、$\dim V$ 为奇数,故值域是更小的奇数维不变子空间,由归纳假设 $T$ 在其上有特征值。

维数账本:以 dim V = 5 为例(设极小多项式没有实的一次因式) V:维数 5(奇数) 5 = 偶数(零空间)+ 奇数(值域,不变且更小) 在值域里重复:3 = 2 + 1 剩下一维不变子空间 ⇒ 特征向量! 偶数维零空间(5.33:成对的「旋转平面」) 奇数维值域
示意图(本教材绘制):5.34 的证明每一步都从奇数维空间里「剥掉」一个偶数维的零空间,剩下一个维数更小、仍在 T 下不变的奇数维值域;奇数减偶数永远是奇数,最后必剩一维——那里就有特征向量。(若中途极小多项式出现实的一次因式,就直接得到特征值。)
联系 5.19(ℂ,任意维)与 5.34(ℝ,奇数维)一起回答了 5A 开头的问题:有限维且 $\dim V\gt 1$(𝐅 = ℂ)时,特征向量张成的直线就是非平凡的不变子空间。𝐅 = ℝ 时,习题 5B.29 进一步证明:维数 ≥ 2 的空间上的每个算子都有二维不变子空间(要么两个特征向量张成,要么是一个「旋转平面」)。
本节要点
  • ℂ 上有限维非零空间的每个算子都有特征值(5.19);证明靠「$n+1$ 个向量必相关」+ 代数基本定理。
  • 极小多项式:使 $p(T)=0$ 的最短首一多项式,唯一,次数 ≤ $\dim V$(5.22、5.24)。计算:看 $v,Tv,T^2v,\dots$ 何时相关(5.25)。
  • 特征值 = 极小多项式的零点(5.27);$q(T)=0$ ⇔ $q$ 是极小多项式的倍式(5.29);不可逆 ⇔ 常数项为 0(5.32)。
  • ℝ 上奇数维空间的算子必有特征值(5.34),因为 $\dim\operatorname{null}(T^2+bT+cI)$ 总是偶数(5.33)。
首一多项式monic polynomial最高次项系数为 1 的多项式,如 $2+9z^2+z^7$。
极小多项式minimal polynomial使 $p(T)=0$ 的次数最低的首一多项式;唯一,$\deg p\le\dim V$,零点恰为特征值。
友矩阵companion matrix次对角线全为 1、最后一列为 $-a_0,\dots,-a_{n-1}$ 的矩阵;它的极小多项式恰为 $a_0+a_1z+\cdots+z^n$(习题 5B.16)。

为什么 ℝ³ 上的每个算子都至少有一个实特征值?

5C 上三角矩阵 Upper-Triangular Matrices

这一节要解决的问题:找到一组基,让算子的矩阵尽量简单。特征向量不一定够多,但我们可以退而求其次——让矩阵的对角线以下全是 0,即上三角矩阵。它的好处立竿见影:对角线上写着全部特征值。

定义算子的矩阵matrix of an operator, ℳ(T)5.35

设 $T\in\mathcal{L}(V)$,$v_1,\dots,v_n$ 是 $V$ 的基。$T$ 关于这组基的矩阵是 $n\times n$ 矩阵 $\mathcal{M}(T)$,其元素 $A_{j,k}$ 由 $$Tv_k=A_{1,k}v_1+\cdots+A_{n,k}v_n$$ 确定。基不明确时写作 $\mathcal{M}\big(T,(v_1,\dots,v_n)\big)$。

与第 3 章不同,算子只用一组基(出发和到达是同一个空间),所以矩阵是方阵。记住页边注那句话:第 $k$ 列 = 把 $Tv_k$ 写成基的线性组合时用到的系数。𝐅ⁿ 上不指明基时默认用标准基,此时第 $k$ 列就是 $T$ 作用于第 $k$ 个标准基向量的结果。

例关于标准基的矩阵5.36

$T\in\mathcal{L}(\mathbf{F}^3)$,$T(x,y,z)=(2x+y,\ 5y+3z,\ 8z)$,则 $\mathcal{M}(T)=\begin{pmatrix}2 & 1 & 0\\ 0 & 5 & 3\\ 0 & 0 & 8\end{pmatrix}$。

线性代数的一个核心目标:给定算子,找一组基使矩阵足够简单——说得具体些,让矩阵里有很多 0。在 𝐅 = ℂ 上我们已经能做一点:取一个特征值 $\lambda$(5.19 保证存在)及其特征向量 $v$,把 $v$ 扩充成基,那么第一列就是 $(\lambda,0,\dots,0)^{\mathsf T}$(因为 $Tv=\lambda v$)。下面要做得更多。

定义矩阵的对角线diagonal of a matrix5.37

方阵的对角线由从左上角到右下角那条线上的元素组成。例 5.36 的对角线是 2, 5, 8。

定义上三角矩阵upper-triangular matrix5.38

对角线以下元素全为 0 的方阵称为上三角矩阵,通常写成 $$\begin{pmatrix}\lambda_1 & & * \\ & \ddots & \\ 0 & & \lambda_n\end{pmatrix}.$$

这里 ∗ 表示我们不关心的元素,左下角的 0 表示对角线以下全是 0。$n$ 很大时,上三角矩阵差不多一半元素是 0——「相当简单」。

定理上三角的等价条件conditions for upper-triangular matrix5.39

设 $T\in\mathcal{L}(V)$,$v_1,\dots,v_n$ 是 $V$ 的基。下列等价:

(a) $T$ 关于 $v_1,\dots,v_n$ 的矩阵是上三角的;
(b) 对每个 $k=1,\dots,n$,$\operatorname{span}(v_1,\dots,v_k)$ 在 $T$ 下不变;
(c) 对每个 $k=1,\dots,n$,$Tv_k\in\operatorname{span}(v_1,\dots,v_k)$。

证明思路

(c) 就是 (a) 的「逐列翻译」:第 $k$ 列对角线以下为 0 ⇔ 写 $Tv_k$ 时只用到 $v_1,\dots,v_k$。(a)⇒(b):$j\le k$ 时 $Tv_j\in\operatorname{span}(v_1,\dots,v_j)\subseteq\operatorname{span}(v_1,\dots,v_k)$,所以这个张成被映回自身。(b)⇒(c) 显然。

span(v₁) span(v₁, v₂) V = span(v₁, v₂, v₃) 红箭头:T 把直线送回直线、把平面送回平面 λ₁∗∗ 0λ₂∗ 00λ₃ 第 1 列:Tv₁ ∈ span(v₁) 第 2 列:Tv₂ ∈ span(v₁, v₂) 第 3 列:Tv₃ ∈ span(v₁, v₂, v₃) ℳ(T, (v₁, v₂, v₃))
示意图(本教材绘制):上三角 ⇔ 一串嵌套的不变子空间 span(v₁) ⊂ span(v₁,v₂) ⊂ ⋯ ⊂ V。特别地,v₁ 一定是特征向量(第一列只有 λ₁)。
换一组基,让矩阵变成上三角

拖动两个基向量 $v_1$(蓝)和 $v_2$(橙)的尖端;虚线箭头是 $Tv_1$、$Tv_2$。读数给出 $T$ 关于基 $v_1,v_2$ 的矩阵(第 $k$ 列 = $Tv_k$ 在这组基下的坐标)。把 $v_1$ 转到能让 $Tv_1$ 落在直线 span(v₁) 上的方向(靠近时会自动吸附),左下角就变成 0。

二维时,上三角只要求一件事:$v_1$ 是特征向量(5.39 (c) 对 $k=2$ 自动成立)。此时对角线上出现的恰是特征值,这就是 5.41;$v_2$ 可以随便取(只要不与 $v_1$ 共线),右上角的 ∗ 随之改变。若 $v_2$ 也是特征向量,矩阵就成了对角的——但对 [2 1; 0 2] 这做不到,它只有一条特征直线。旋转 90° 在 ℝ² 中找不到任何特征方向,所以在 ℝ 上无法上三角化。

定理上三角矩阵的算子满足的方程equation satisfied by operator with upper-triangular matrix5.40

设 $T\in\mathcal{L}(V)$ 关于某组基有对角元为 $\lambda_1,\dots,\lambda_n$ 的上三角矩阵,则 $$(T-\lambda_1I)\cdots(T-\lambda_nI)=0 .$$

证明思路

关键观察:$T-\lambda_kI$ 把 $\operatorname{span}(v_1,\dots,v_k)$ 映进 $\operatorname{span}(v_1,\dots,v_{k-1})$——因为第 $k$ 个对角元恰好被减掉了,$(T-\lambda_kI)v_k$ 不再含 $v_k$ 分量。于是任何向量经过 $T-\lambda_nI$、$T-\lambda_{n-1}I$、……、$T-\lambda_1I$,每经过一个因子就「下一级台阶」,$n$ 步之后必为 0。(原书按 $v_1,v_2,\dots$ 逐个验证,并利用各因子可交换。)下面的步骤演示用例 5.36 的矩阵走一遍。

起点:任取一个向量

$T$ 的矩阵是例 5.36 的 $\begin{pmatrix}2 & 1 & 0\\ 0 & 5 & 3\\ 0 & 0 & 8\end{pmatrix}$,对角元 2, 5, 8。取 $u=(1,2,3)$,它在最高一级台阶 $V=\mathbf{F}^3$ 上。

作用 $T-8I$:下降到 span(e₁, e₂)

$(T-8I)u=(2+2-8,\ 10+9-16,\ 24-24)=(-4,3,0)$。第 3 个坐标一定是 0:矩阵第 3 行只有对角元 8,减去 $8I$ 后整行为 0。

作用 $T-5I$:下降到 span(e₁)

$(T-5I)(-4,3,0)=(-8+3+20,\ 15-15,\ 0)=(15,0,0)$。同理,在 span(e₁, e₂) 里第 2 个坐标被「减掉」了。

作用 $T-2I$:下降到 {0}

$(T-2I)(15,0,0)=(30-30,0,0)=0$。三步走完,到达原点。

结论:每个向量都会走到 0

起点换成任何向量都一样:每个因子让它下降一级,3 级台阶走 3 步必到 0。所以 $(T-2I)(T-5I)(T-8I)=0$,正是 5.40。(因为这些因子可交换,顺序无关紧要。)由 5.29,这也说明极小多项式整除 $(z-2)(z-5)(z-8)$。

定理由上三角矩阵读出特征值determination of eigenvalues from upper-triangular matrix5.41

设 $T\in\mathcal{L}(V)$ 关于某组基有上三角矩阵。则 $T$ 的特征值恰好是这个上三角矩阵对角线上的元素。

证明思路

对角元都是特征值:$Tv_1=\lambda_1v_1$,故 $\lambda_1$ 是特征值。$k\ge 2$ 时,$T-\lambda_kI$ 把 $k$ 维的 $\operatorname{span}(v_1,\dots,v_k)$ 映进 $k-1$ 维的 $\operatorname{span}(v_1,\dots,v_{k-1})$,维数变小,不可能是单射(原书 3.22),所以有非零 $v$ 使 $(T-\lambda_kI)v=0$。

没有别的特征值:由 5.40,$q(z)=(z-\lambda_1)\cdots(z-\lambda_n)$ 满足 $q(T)=0$,所以 $q$ 是极小多项式的倍式(5.29),极小多项式的零点——即特征值(5.27)——都在 $\lambda_1,\dots,\lambda_n$ 之中。

例借助上三角矩阵求特征值5.42

例 5.36 的 $T(x,y,z)=(2x+y,5y+3z,8z)$ 关于标准基的矩阵是上三角的,对角线为 2, 5, 8,所以由 5.41,$T$ 的特征值就是 2、5、8。

常见误区 5.41 只对上三角矩阵成立。一般矩阵的对角元与特征值毫无关系:$\begin{pmatrix}0 & 1\\ 1 & 0\end{pmatrix}$ 对角全为 0,但它可逆,0 不是特征值(习题 5C.4);$\begin{pmatrix}1 & 1\\ 1 & 1\end{pmatrix}$ 对角全非零,却不可逆(习题 5C.5)。
例能否上三角化取决于 𝐅5.43

$T\in\mathcal{L}(\mathbf{F}^4)$,$T(z_1,z_2,z_3,z_4)=(-z_2,\ z_1,\ 2z_1+3z_3,\ z_3+3z_4)$,关于标准基的矩阵为 $$\begin{pmatrix}0 & -1 & 0 & 0\\ 1 & 0 & 0 & 0\\ 2 & 0 & 3 & 0\\ 0 & 0 & 1 & 3\end{pmatrix},$$ 极小多项式是 $p(z)=9-6z+10z^2-6z^3+z^4$。

𝐅 = ℝ:$p(z)=(z^2+1)(z-3)(z-3)$,$z^2+1$ 不能再分解成实的一次因式,所以(由下面的 5.44)ℝ⁴ 中不存在使 $T$ 为上三角的基。

𝐅 = ℂ:$p(z)=(z-i)(z+i)(z-3)(z-3)$,全是一次因式,所以存在这样的基。事实上关于基 $(4-3i,-3-4i,-3+i,1)$,$(4+3i,-3+4i,-3-i,1)$,$(0,0,0,1)$,$(0,0,1,0)$,$T$ 的矩阵是 $$\begin{pmatrix}i & 0 & 0 & 0\\ 0 & -i & 0 & 0\\ 0 & 0 & 3 & 1\\ 0 & 0 & 0 & 3\end{pmatrix}.$$ (在「极小多项式计算器」里选例 5.43,切换 𝐅 = ℝ / ℂ 对比结论。)

定理可上三角化的充要条件necessary and sufficient condition to have an upper-triangular matrix5.44

设 $V$ 有限维,$T\in\mathcal{L}(V)$。则 $T$ 关于某组基有上三角矩阵,当且仅当 $T$ 的极小多项式等于 $(z-\lambda_1)\cdots(z-\lambda_m)$,其中 $\lambda_1,\dots,\lambda_m\in\mathbf{F}$(允许重复)。

证明思路

⇒:设对角元为 $\alpha_1,\dots,\alpha_n$。由 5.40,$(z-\alpha_1)\cdots(z-\alpha_n)$ 能消灭 $T$,所以它是极小多项式的倍式(5.29);因此极小多项式也是若干 $(z-\lambda_k)$ 之积。

⇐(对 $m$ 归纳):$m=1$ 时 $T=\lambda_1I$,任何基都行。$m\gt 1$ 时令 $U=\operatorname{range}(T-\lambda_mI)$,它在 $T$ 下不变(5.18)。对 $u=(T-\lambda_mI)v\in U$,有 $(T-\lambda_1I)\cdots(T-\lambda_{m-1}I)u=0$,所以 $T|_U$ 的极小多项式至多有 $m-1$ 个一次因式,由归纳假设 $U$ 有基 $u_1,\dots,u_M$ 使 $T|_U$ 上三角,即 $Tu_k\in\operatorname{span}(u_1,\dots,u_k)$ 5.45。扩充成 $V$ 的基 $u_1,\dots,u_M,v_1,\dots,v_N$。由于 $Tv_k=(T-\lambda_mI)v_k+\lambda_mv_k$ 而 $(T-\lambda_mI)v_k\in U$,得 $Tv_k\in\operatorname{span}(u_1,\dots,u_M,v_1,\dots,v_k)$ 5.46。由 5.39,这组基使 $T$ 上三角。

集合 $\{\lambda_1,\dots,\lambda_m\}$ 就是 $T$ 的特征值集合(5.27),只是列表中可能有重复。

定理𝐅 = ℂ 时每个算子都能上三角化if F = C, then every operator on V has an upper-triangular matrix5.47

设 $V$ 是有限维复向量空间,$T\in\mathcal{L}(V)$。则 $T$ 关于 $V$ 的某组基有上三角矩阵。

证明思路

由 5.44 与代数基本定理(ℂ 上每个多项式都是一次因式之积,原书 4.13)立得。

原书称这是一个「美妙的结果」,并预告第 8 章还会进一步改进它(8.37、8.46);5.80 与习题 5E.9(b) 把它推广到多个可交换算子。

注意:上三角 ≠ 基向量都是特征向量 上三角时,对角元恰是全部特征值,而且 $v_1$ 一定是特征向量;但 $v_2,\dots,v_n$ 未必是。事实上,$v_k$ 是特征向量当且仅当矩阵第 $k$ 列除第 $k$ 个元素外全为 0。
另一个易混点:用行变换把矩阵化成的行阶梯形虽然也是上三角的,但它的对角线不给出特征值——那和这里「换一组基得到的上三角矩阵」毫无关系。而且,虽然 5.47 保证了 ℂ 上这种上三角矩阵存在,却没有办法把它精确地算出来(否则就能精确求出任意多项式的根了)。

$T$ 关于基 $v_1,v_2,v_3$ 的矩阵是上三角的,对角元依次为 4, 4, 7。下列哪项一定成立?

本节要点
  • 算子的矩阵只用一组基;第 $k$ 列是 $Tv_k$ 的坐标。
  • 上三角 ⇔ $Tv_k\in\operatorname{span}(v_1,\dots,v_k)$ ⇔ 一串嵌套的不变子空间(5.39)。
  • 上三角时 $(T-\lambda_1I)\cdots(T-\lambda_nI)=0$(5.40),特征值恰是对角元(5.41)。
  • 能上三角化 ⇔ 极小多项式是一次因式之积(5.44);ℂ 上总能做到(5.47),ℝ 上要看极小多项式有没有 $z^2+bz+c$($b^2\lt 4c$)型因式。
算子的矩阵matrix of an operator, ℳ(T)关于一组基 $v_1,\dots,v_n$:第 $k$ 列是 $Tv_k$ 的坐标。
矩阵的对角线diagonal of a matrix方阵从左上角到右下角的那些元素 $A_{1,1},\dots,A_{n,n}$。
上三角矩阵upper-triangular matrix对角线以下全为 0 的方阵;作为算子的矩阵时,对角元恰为全部特征值。

例 5.43 的算子(极小多项式为 $(z^2+1)(z-3)^2$)能否在 𝐅 = ℝ 时找到使它为上三角的基?

5D 可对角化算子 Diagonalizable Operators

这一节要解决的问题:什么时候能找到一组基,使矩阵只有对角线非零?那时算子就是「沿几个独立方向各自伸缩」,求幂、求多项式都变得轻而易举。答案仍然写在极小多项式里:它要能分解成互不相同的一次因式。最后,Gershgorin 圆盘给出一个不必求解就能「圈住」特征值的办法。

对角矩阵 Diagonal Matrices

定义对角矩阵diagonal matrix5.48

除对角线外全为 0 的方阵。例 5.49:$\begin{pmatrix}8 & 0 & 0\\ 0 & 5 & 0\\ 0 & 0 & 5\end{pmatrix}$。

定义可对角化diagonalizable5.50

$V$ 上的算子称为可对角化的,如果它关于 $V$ 的某组基有对角矩阵。

对角矩阵当然是上三角的,而且 0 多得多;由 5.41,对角元恰好就是特征值(对对角矩阵也可以直接验证)。

例对角化可能需要换一组基5.51

$T\in\mathcal{L}(\mathbf{R}^2)$,$T(x,y)=(41x+7y,\ -20x+74y)$。关于标准基的矩阵 $\begin{pmatrix}41 & 7\\ -20 & 74\end{pmatrix}$ 不是对角的;但关于基 $(1,4),(7,5)$,矩阵是 $\begin{pmatrix}69 & 0\\ 0 & 46\end{pmatrix}$,因为 $T(1,4)=(69,276)=69\,(1,4)$,$T(7,5)=(322,230)=46\,(7,5)$。

对角化 = 换到特征基后,算子就是「沿坐标轴伸缩」

拖动滑块 $t$(0 → 1)让算子逐渐作用:左图在标准坐标下看,图形被「斜着」拉扯;右图把同一件事放到以特征向量 $u_1,u_2$ 为坐标轴的坐标系里看,它只是沿两根轴各自伸缩。选「剪切」看看不可对角化时发生什么。

两幅图演的是同一个算子,只是记账用的坐标不同。右图中方格始终是方格(只被拉成长方形),「F」字母只是被横竖拉伸;左图中网格沿特征方向伸缩,看上去像是被「剪」歪了。斜反射在右图里就是一根轴不动、另一根轴翻转。剪切没有两条特征直线,所以不存在右边那种坐标系——这就是「不可对角化」的几何含义。

定义特征空间eigenspace, E(λ, T)5.52

设 $T\in\mathcal{L}(V)$,$\lambda\in\mathbf{F}$。$T$ 对应于 $\lambda$ 的特征空间是子空间 $$E(\lambda,T)=\operatorname{null}(T-\lambda I)=\{v\in V:\ Tv=\lambda v\}.$$ 它由对应于 $\lambda$ 的全部特征向量再加上 0 组成。$\lambda$ 是特征值 ⇔ $E(\lambda,T)\ne\{0\}$。$T$ 限制在 $E(\lambda,T)$ 上就是「乘以 $\lambda$」。

例特征空间5.53

若 $T$ 关于基 $v_1,v_2,v_3$ 的矩阵是例 5.49 的 diag(8, 5, 5),则 $E(8,T)=\operatorname{span}(v_1)$,$E(5,T)=\operatorname{span}(v_2,v_3)$——一条直线和一个平面。

定理特征空间之和是直和sum of eigenspaces is a direct sum5.54

设 $T\in\mathcal{L}(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的互不相同的特征值。则 $E(\lambda_1,T)+\cdots+E(\lambda_m,T)$ 是直和;若 $V$ 有限维,还有 $$\dim E(\lambda_1,T)+\cdots+\dim E(\lambda_m,T)\le\dim V .$$

证明思路

若 $v_1+\cdots+v_m=0$,$v_k\in E(\lambda_k,T)$,其中非零的 $v_k$ 是对应不同特征值的特征向量,由 5.11 线性无关,所以只能都为 0——这正是直和的判据(原书 1.45)。维数不等式来自直和的维数公式(原书 3.94)。

可对角化的条件 Conditions for Diagonalizability

定理可对角化的等价条件conditions equivalent to diagonalizability5.55

设 $V$ 有限维,$T\in\mathcal{L}(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的全部互异特征值。下列等价:

(a) $T$ 可对角化;
(b) $V$ 有一组由 $T$ 的特征向量组成的基;
(c) $V=E(\lambda_1,T)\oplus\cdots\oplus E(\lambda_m,T)$;
(d) $\dim V=\dim E(\lambda_1,T)+\cdots+\dim E(\lambda_m,T)$ 5.56。

证明思路

(a)⇔(b):矩阵是 diag$(\lambda_1,\dots,\lambda_n)$ ⇔ $Tv_k=\lambda_kv_k$ 对每个 $k$ 成立。(b)⇒(c):每个向量是特征向量的组合,所以 $V$ 是特征空间之和,再由 5.54 是直和。(c)⇒(d):直和的维数相加。(d)⇒(b):把每个特征空间的基拼在一起,共 $\dim V$ 个向量;它们线性无关(把一个线性关系按特征空间分组,每组之和 $u_k\in E(\lambda_k,T)$,由 5.11 各 $u_k=0$,再由各组是基得系数全为 0),所以是基。

直觉:维数够不够「分」 各个特征空间天然互不重叠(5.54)。可对角化,就是它们的维数加起来恰好填满 $V$;不可对角化,就是加起来不够——总有些方向不属于任何特征空间。
例一个不可对角化的算子5.57

$T\in\mathcal{L}(\mathbf{F}^3)$,$T(a,b,c)=(b,c,0)$,矩阵 $\begin{pmatrix}0 & 1 & 0\\ 0 & 0 & 1\\ 0 & 0 & 0\end{pmatrix}$ 是上三角的但不是对角的。0 是唯一的特征值,且 $E(0,T)=\{(a,0,0):a\in\mathbf{F}\}$ 只有 1 维 $\lt 3$。5.55 的 (d) 不成立,所以无论 𝐅 = ℝ 还是 ℂ,$T$ 都不可对角化。

定理特征值足够多则可对角化enough eigenvalues implies diagonalizability5.58

设 $V$ 有限维,$T\in\mathcal{L}(V)$ 有 $\dim V$ 个互不相同的特征值,则 $T$ 可对角化。

证明思路

每个特征值取一个特征向量,由 5.11 这 $\dim V$ 个向量线性无关,因而是基(原书 2.38)——一组由特征向量组成的基。

这个条件充分但不必要:$T(x,y,z)=(6x,6y,7z)$ 只有两个特征值 6、7,却显然可对角化(标准基就行)。第 7 章的谱定理(7.29、7.31)会给出另一类保证可对角化的条件。

例用对角化计算 $T^{100}$5.59

$T(x,y,z)=(2x+y,5y+3z,8z)$,矩阵 $\begin{pmatrix}2 & 1 & 0\\ 0 & 5 & 3\\ 0 & 0 & 8\end{pmatrix}$。由 5.41 特征值为 2, 5, 8;三维空间有三个互异特征值,由 5.58 可对角化。解 $T(x,y,z)=\lambda(x,y,z)$ 得特征向量:$\lambda=2$:$(1,0,0)$;$\lambda=5$:$(1,3,0)$;$\lambda=8$:$(1,6,6)$。关于这组基,矩阵是 diag(2, 5, 8)。

要算 $T^{100}(0,0,1)$,先把 $(0,0,1)$ 写成特征向量的组合:$(0,0,1)=\tfrac16(1,0,0)-\tfrac13(1,3,0)+\tfrac16(1,6,6)$。再对每一项用 $T^{100}v=\lambda^{100}v$: $$T^{100}(0,0,1)=\tfrac16\big(2^{100}-2\cdot 5^{100}+8^{100},\ \ 6\cdot 8^{100}-6\cdot 5^{100},\ \ 6\cdot 8^{100}\big).$$

直觉:在特征基里,求幂就是各自乘方 把向量拆成特征向量的分量,$T^k$ 对每个分量只是乘以 $\lambda^k$。$k$ 很大时,绝对值最大的特征值的分量会「压倒」其他分量——于是 $T^kv$ 的方向越来越接近主特征方向(数值计算中的幂迭代正是利用了这一点)。原书习题 5D.21 用同样的办法得到斐波那契数列的通项公式(见本章习题)。
反复作用 T:Tᵏv 的方向向主特征方向靠拢

左图:拖动蓝色的起始向量 $v$;紫色虚线是两条特征直线。拖动滑块 $k$(或点「播放」),红色箭头是 $T^kv$ 的方向(已缩放到固定长度),淡色圆点是之前各步的方向;两条虚线段是它沿两个特征方向的分量。右图:每一步两个分量所占的比例。

只要 $v$ 在主特征方向上有非零分量,$|\lambda_1|\gt|\lambda_2|$ 时,次要分量所占比例按 $|\lambda_2/\lambda_1|^k$ 的速度衰减:[2 1; 1 2] 衰减得快(比值 1/3),例 5.51 衰减得慢(比值 2/3)。斐波那契的例子里,$T^k(0,1)=(F_k,F_{k+1})$,方向趋于 $(1,\varphi)$,所以 $F_{k+1}/F_k\to\varphi\approx 1.618$(黄金比)。两个特征值绝对值相等时方向来回跳、不收敛;复特征值(旋转)时根本没有实特征方向可靠拢。

例可对角化,但特征值无法精确求出5.60

例 5.28 的 $T\in\mathcal{L}(\mathbf{C}^5)$ 的极小多项式 $3-6z+z^5$ 的零点约为 $-1.67,\ 0.51,\ 1.40,\ -0.12\pm1.59i$。数值精度足以断定这 5 个数互不相同,所以极小多项式是 5 个互异一次因式之积,由下面的 5.62,$T$ 可对角化——尽管我们写不出任何一个特征值的精确值。

例证明一个算子不可对角化5.61

$T(z_1,z_2,z_3)=(6z_1+3z_2+4z_3,\ 6z_2+2z_3,\ 7z_3)$,矩阵 $\begin{pmatrix}6 & 3 & 4\\ 0 & 6 & 2\\ 0 & 0 & 7\end{pmatrix}$ 上三角但不对角。特征值是对角元 6、7(5.41),所以极小多项式的零点是 6、7(5.27);由 5.40,$(T-6I)^2(T-7I)=0$;次数 ≤ 3(5.22)。因此极小多项式只能是 $(z-6)(z-7)$ 或 $(z-6)^2(z-7)$。直接计算 $(T-6I)(T-7I)=\begin{pmatrix}0 & -3 & 6\\ 0 & 0 & 0\\ 0 & 0 & 0\end{pmatrix}\ne 0$,所以极小多项式是 $(z-6)^2(z-7)$——有重复因式,由 5.62 不可对角化。

定理可对角化的充要条件necessary and sufficient condition for diagonalizability5.62

设 $V$ 有限维,$T\in\mathcal{L}(V)$。则 $T$ 可对角化,当且仅当 $T$ 的极小多项式等于 $(z-\lambda_1)\cdots(z-\lambda_m)$,其中 $\lambda_1,\dots,\lambda_m\in\mathbf{F}$ 互不相同。

证明思路

⇒:有特征向量基 $v_1,\dots,v_n$;设 $\lambda_1,\dots,\lambda_m$ 是互异特征值。每个 $v_j$ 都被某个因子 $T-\lambda_kI$ 消灭,而各因子可交换,所以 $(T-\lambda_1I)\cdots(T-\lambda_mI)$ 消灭每个基向量,等于 0;它的零点恰是全部特征值,由 5.29、5.27 它就是极小多项式。

⇐(对 $m$ 归纳):$(T-\lambda_1I)\cdots(T-\lambda_mI)=0$ 5.63。$\operatorname{range}(T-\lambda_mI)$ 不变,且其中的 $u$ 满足 $(T-\lambda_1I)\cdots(T-\lambda_{m-1}I)u=0$ 5.64,由归纳假设它有特征向量基。若 $u$ 同时在 $\operatorname{null}(T-\lambda_mI)$ 中,则 $Tu=\lambda_mu$,代入 5.64 得 $(\lambda_m-\lambda_1)\cdots(\lambda_m-\lambda_{m-1})u=0$;因为 λ 互不相同,$u=0$。所以值域与零空间只交于 0,维数又相加为 $\dim V$,于是 $V=\operatorname{range}(T-\lambda_mI)\oplus\operatorname{null}(T-\lambda_mI)$。把两边的特征向量基拼起来即可。「互不相同」正是用在这一步。

性质用极小多项式 $p$ 刻画原书例子
可上三角化 5.44$p=(z-\lambda_1)\cdots(z-\lambda_m)$,允许重复例 5.61:$(z-6)^2(z-7)$ ✓ 上三角,✗ 对角
可对角化 5.62$p=(z-\lambda_1)\cdots(z-\lambda_m)$,互不相同例 5.59:$(z-2)(z-5)(z-8)$ ✓ 对角
两者都不行(𝐅 = ℝ)$p$ 含无实根的二次因式例 5.43:$(z^2+1)(z-3)^2$

原书还指出:5 次以上多项式没有求根公式,但判断「有没有重根」不需要求根——习题 5D.15 证明,在 ℂ 上 $T$ 可对角化 ⇔ $p$ 与其导数 $p'$ 没有公共零点 ⇔ $p$ 与 $p'$ 的最大公因式为 1,而最大公因式可以用辗转相除法快速算出。(前面的「极小多项式计算器」判断可对角化时正是这样做的。)

定理可对角化算子在不变子空间上的限制仍可对角化restriction of diagonalizable operator to invariant subspace5.65

设 $T\in\mathcal{L}(V)$ 可对角化,$U$ 是 $T$ 的不变子空间,则 $T|_U$ 是 $U$ 上的可对角化算子。

证明思路

$T$ 的极小多项式是互异一次因式之积(5.62),而它是 $T|_U$ 的极小多项式的倍式(5.31);「互异一次因式之积」的因式仍是这种形状,再用 5.62。——这个短证明展示了用极小多项式刻画可对角化的威力;5.76 会用到它。

$T$ 的极小多项式是 $(z-6)^2(z-7)$。下面哪个说法正确?

Gershgorin 圆盘定理 Gershgorin Disk Theorem

特征值一般没法精确求出,但我们常常只需要知道它们大概在哪儿。Gershgorin 圆盘只看矩阵元素,就能画出几个一定「罩住」全部特征值的圆盘。

定义Gershgorin 圆盘Gershgorin disks5.66

设 $T\in\mathcal{L}(V)$,$v_1,\dots,v_n$ 是 $V$ 的基,$A$ 是 $T$ 关于这组基的矩阵。形如 $$\Big\{z\in\mathbf{F}:\ |z-A_{j,j}|\le\sum_{k=1,\,k\ne j}^{n}|A_{j,k}|\Big\}\qquad(j=1,\dots,n)$$ 的集合称为 $T$ 关于这组基的 Gershgorin 圆盘。

𝐅 = ℂ 时,第 $j$ 个圆盘是复平面上以对角元 $A_{j,j}$ 为圆心、以第 $j$ 行其余元素绝对值之和为半径的闭圆盘(共 $n$ 个);𝐅 = ℝ 时它们是实数轴上的闭区间。$A$ 是对角矩阵时,每个圆盘缩成一个点。

定理Gershgorin 圆盘定理Gershgorin disk theorem5.67

设 $T\in\mathcal{L}(V)$,$v_1,\dots,v_n$ 是 $V$ 的基。则 $T$ 的每个特征值都落在 $T$ 关于这组基的某个 Gershgorin 圆盘里。

证明思路:盯住特征向量「最大」的那个坐标

设 $Tw=\lambda w$,$w=c_1v_1+\cdots+c_nv_n$ 5.68。两边作用 $T$ 并比较 $v_j$ 的系数(5.69 5.70)得 $\lambda c_j=\sum_k A_{j,k}c_k$。取 $j$ 使 $|c_j|$ 最大(于是 $c_j\ne 0$ 且 $|c_k/c_j|\le 1$),移项并除以 $c_j$: $$|\lambda-A_{j,j}|=\Big|\sum_{k\ne j}A_{j,k}\frac{c_k}{c_j}\Big|\le\sum_{k\ne j}|A_{j,k}| .$$ 所以 $\lambda$ 落在第 $j$ 个圆盘里。

推论:非对角元越小,特征值离对角元越近。原书页边注:此定理以 Semyon Aronovich Gershgorin 命名,发表于 1931 年。

Gershgorin 圆盘:特征值逃不出这些圆

复平面上画出 3×3 实矩阵 $A$ 的三个 Gershgorin 圆盘(圆心 = 对角元,半径 = 同行其余元素绝对值之和),黑色 × 是真正的特征值(数值计算)。可以左右拖动圆心改变对角元,或直接编辑矩阵;滑块 ε 把所有非对角元同时乘以 ε,看圆盘如何从「点」长大、特征值如何离开对角元。

矩阵 A(可编辑,步长 0.5)

无论怎么拖、怎么改,每个 × 都落在某个圆盘里。ε = 0 时矩阵是对角的,圆盘缩成点、特征值就是对角元;ε 增大,圆盘长大,特征值也随之离开圆心——但始终逃不出圆盘的并集。「对角占优」的例子里没有圆盘罩住 0,所以 0 不是特征值,矩阵可逆(习题 5D.22)。勾选「用列求半径」,圆盘变了,特征值却依然落在其中(习题 5D.23)。

本节要点
  • 可对角化 ⇔ 有特征向量基 ⇔ 特征空间的维数之和 = $\dim V$(5.55);$\dim V$ 个互异特征值是充分条件(5.58)。
  • 可对角化 ⇔ 极小多项式是互异一次因式之积(5.62);限制在不变子空间上仍可对角化(5.65)。
  • 对角化让 $T^k$ 变得好算:在特征基中只需各自乘方(5.59),主特征值的分量最终占优。
  • Gershgorin:每个特征值都在某个「对角元为心、行和为径」的圆盘里(5.67)。
对角矩阵diagonal matrix除对角线外全为 0 的方阵。
可对角化diagonalizable关于某组基有对角矩阵 ⇔ 有由特征向量组成的基 ⇔ 极小多项式是互异一次因式之积。
特征空间eigenspace, E(λ, T)$E(\lambda,T)=\operatorname{null}(T-\lambda I)$:全部对应于 $\lambda$ 的特征向量再加上 0。
Gershgorin 圆盘Gershgorin disk以 $A_{j,j}$ 为圆心、$\sum_{k\ne j}|A_{j,k}|$ 为半径的闭圆盘;每个特征值都落在某一个里。

矩阵 $\begin{pmatrix}5 & 1\\ 2 & -3\end{pmatrix}$ 的特征值一定落在哪里?

5E 可交换算子 Commuting Operators

这一节要解决的问题:手里有两个算子时,能不能用同一组基把它们同时化简(同时对角化、同时上三角化)?答案出奇地简洁:只要它们可交换。关键原因是:可交换的算子会保持彼此的特征空间。

定义可交换commute5.71

同一向量空间上的两个算子 $S,T$ 称为可交换的,如果 $ST=TS$;两个同阶方阵 $A,B$ 可交换,如果 $AB=BA$。

例:$\lambda I$ 与每个算子可交换;$T^2$ 与 $T^3$ 可交换;更一般地,对任意多项式 $p,q$,$p(T)$ 与 $q(T)$ 可交换(5.17(b))。

例偏导数算子可交换5.72

设 $\mathcal{P}_m(\mathbf{C}^2,\mathbf{C})$ 是二元、次数 ≤ $m$ 的复系数多项式构成的空间,元素形如 $p(w,z)=\sum_{j+k\le m}a_{j,k}w^jz^k$ 5.73。定义偏导数算子 $D_wp=\partial p/\partial w$,$D_zp=\partial p/\partial z$(对一个变量求导,把另一个当常数)。因为 $(D_wD_z)p=\sum jk\,a_{j,k}w^{j-1}z^{k-1}=(D_zD_w)p$,所以 $D_wD_z=D_zD_w$——这是「对好函数,求偏导的次序无关紧要」的一个特例。

可交换的矩阵其实很稀少 原书页边注做了个统计:元素都是 $[-5,5]$ 中整数的 2×2 矩阵有 $11^4$ 个,有序对共 $11^8=214{,}358{,}881$ 个,计算机逐一检查后发现只有 $674{,}609$ 对可交换,约 0.3%。(下面的演示可以随机抽样验证这个比例。)所以「可交换」是一个很强的条件——也难怪它能换来很强的结论。
定理算子可交换 ⇔ 矩阵可交换commuting operators correspond to commuting matrices5.74

设 $S,T\in\mathcal{L}(V)$,$v_1,\dots,v_n$ 是 $V$ 的基。则 $S,T$ 可交换当且仅当 $\mathcal{M}(S)$ 与 $\mathcal{M}(T)$(关于同一组基)可交换。

证明思路

$ST=TS$ ⇔ $\mathcal{M}(ST)=\mathcal{M}(TS)$ ⇔ $\mathcal{M}(S)\mathcal{M}(T)=\mathcal{M}(T)\mathcal{M}(S)$(矩阵乘法对应映射复合)。

定理特征空间在可交换算子下不变eigenspace is invariant under commuting operator5.75

设 $S,T\in\mathcal{L}(V)$ 可交换,$\lambda\in\mathbf{F}$。则 $E(\lambda,S)$ 在 $T$ 下不变。

证明(一行)

若 $v\in E(\lambda,S)$,则 $S(Tv)=(ST)v=(TS)v=T(Sv)=T(\lambda v)=\lambda Tv$,即 $Tv\in E(\lambda,S)$。

直觉 $S$ 的特征空间是「$S$ 只做伸缩的地方」。$T$ 与 $S$ 可交换,意味着「先 $T$ 后 $S$」与「先 $S$ 后 $T$」一样,所以 $T$ 不会把一个「被 $S$ 伸缩 λ 倍的向量」变成「被 $S$ 伸缩别的倍数」的向量——它只能在 $E(\lambda,S)$ 内部搬动。如果 $E(\lambda,S)$ 是一条直线,$T$ 就只能沿这条直线伸缩:这条直线也成了 $T$ 的特征直线!原书说,这是可交换算子「表现更好」的主要原因之一。
定理可同时对角化 ⇔ 可交换simultaneous diagonalizability ⟺ commutativity5.76

同一空间上的两个可对角化算子关于同一组基都有对角矩阵,当且仅当它们可交换。

证明思路

⇒:两个同阶对角矩阵的乘积就是对角元逐个相乘,与次序无关,所以对角矩阵可交换,再用 5.74。

⇐:设 $\lambda_1,\dots,\lambda_m$ 是 $S$ 的互异特征值,$S$ 可对角化,故 $V=E(\lambda_1,S)\oplus\cdots\oplus E(\lambda_m,S)$ 5.77。每个 $E(\lambda_k,S)$ 在 $T$ 下不变(5.75),而可对角化的 $T$ 限制到不变子空间上仍可对角化(5.65),所以每个 $E(\lambda_k,S)$ 都有一组由 $T$ 的特征向量组成的基。拼起来就是 $V$ 的一组基,其中每个向量同时是 $S$ 和 $T$ 的特征向量。

为什么要「同时」?比如想研究 $S+T$ 或 $ST$,最好两个算子在同一组基下都是对角的——那样 $S+T$、$ST$ 也就是对角的了。

可交换 ⇒ T 保持 S 的特征直线 ⇒ 公共特征向量

$S$ 固定(紫色虚线是它的两条特征直线,紫色箭头 $u_1,u_2$ 是特征向量)。拖动 $Te_1$、$Te_2$ 的尖端(即 $T$ 矩阵的两列)来改变 $T$;红色箭头是 $Tu_1$、$Tu_2$,绿色点线是 $T$ 自己的特征直线(若为实的)。读数给出 $ST-TS$。当它为 0 时,红色箭头会落回紫色直线上。

随手拖出来的 $T$ 几乎总是不可交换的:$Tu_1$、$Tu_2$ 偏离紫色直线,$T$ 自己的特征直线(绿)也和 $S$ 的不重合。一旦 $ST=TS$,$T$ 就把 $S$ 的每条特征直线映回自身(5.75),$u_1,u_2$ 同时成了 $T$ 的特征向量,绿线与紫线重合——同一组基 $u_1,u_2$ 同时对角化 $S$ 与 $T$(5.76)。当 $S$ 有两个不同特征值时,与它可交换的 $T$ 恰好是 $aI+bS$ 这一族(可由习题 5D.13 推出),「$S^2-3S+I$」正是其中一员。

定理可交换算子有公共特征向量common eigenvector for commuting operators5.78

有限维非零复向量空间上的每一对可交换算子都有公共特征向量。

证明思路

取 $S$ 的特征值 $\lambda$(5.19),$E(\lambda,S)\ne\{0\}$ 且在 $T$ 下不变(5.75)。于是 $T|_{E(\lambda,S)}$ 是非零复空间上的算子,由 5.19 有特征向量——它同时是 $S$ 和 $T$ 的特征向量。注意:两个算子未必有公共特征值。

例偏导数算子的公共特征向量5.79

对例 5.72 的 $D_w,D_z$:两者唯一的特征值都是 0,且 $E(0,D_w)=\{\sum_k a_kz^k\}$(不含 $w$ 的多项式),$E(0,D_z)=\{\sum_j c_jw^j\}$(不含 $z$ 的多项式)。两个特征空间的交是常数函数——非零常数就是公共特征向量,正如 5.78 所保证。

定理可交换算子可同时上三角化commuting operators are simultaneously upper triangularizable5.80

设 $V$ 是有限维复向量空间,$S,T$ 是 $V$ 上可交换的算子。则存在 $V$ 的一组基,使 $S$ 和 $T$ 关于它都有上三角矩阵。

证明思路(对维数归纳,思路同 5.47)

取公共特征向量 $v_1$(5.78),则 $Sv_1,Tv_1\in\operatorname{span}(v_1)$。取补空间 $W$ 使 $V=\operatorname{span}(v_1)\oplus W$,令 $P(av_1+w)=w$ 为到 $W$ 上的投影,定义 $W$ 上的算子 $\hat Sw=P(Sw)$、$\hat Tw=P(Tw)$。利用 $v_1$ 是 $S$、$T$ 的特征向量且 $Pv_1=0$,可验证 $\hat S\hat T=\hat T\hat S$。由归纳假设,$W$ 有基 $v_2,\dots,v_n$ 使 $\hat S,\hat T$ 都上三角。由于 $Sv_k=a_kv_1+\hat Sv_k$、$Tv_k=b_kv_1+\hat Tv_k$,得 $Sv_k,Tv_k\in\operatorname{span}(v_1,\dots,v_k)$,由 5.39 两者关于 $v_1,\dots,v_n$ 都上三角。

定理可交换算子之和与积的特征值eigenvalues of sum and product of commuting operators5.81

设 $V$ 是有限维复向量空间,$S,T$ 是 $V$ 上可交换的算子。则

  • $S+T$ 的每个特征值都是「$S$ 的某个特征值 + $T$ 的某个特征值」;
  • $ST$ 的每个特征值都是「$S$ 的某个特征值 × $T$ 的某个特征值」。
证明思路

取使两者同时上三角的基(5.80)。上三角矩阵相加、相乘仍是上三角的,且对角元分别相加、相乘(习题 5C.2)。$S+T$、$ST$ 的特征值就在各自的对角线上(5.41),而 $\mathcal{M}(S)$、$\mathcal{M}(T)$ 的对角元分别是 $S$、$T$ 的特征值。

常见误区:特征值不能随便相加、相乘 一般情况下,由 $S$、$T$ 的特征值推不出 $S+T$、$ST$ 的特征值。例如 $S=\begin{pmatrix}0 & 1\\ 0 & 0\end{pmatrix}$,$T=\begin{pmatrix}0 & 0\\ 1 & 0\end{pmatrix}$ 的特征值都只有 0,但 $S+T=\begin{pmatrix}0 & 1\\ 1 & 0\end{pmatrix}$ 的特征值是 $\pm1$,$ST=\begin{pmatrix}1 & 0\\ 0 & 0\end{pmatrix}$ 有特征值 1——原因是 $ST\ne TS$。另外 5.81 要求 𝐅 = ℂ:实空间上即使可交换也可能不成立(习题 5E.10,见本章习题)。
本节要点
  • 可交换算子保持彼此的特征空间(5.75)——这是本节一切结论的发动机。
  • 两个可对角化算子可同时对角化 ⇔ 可交换(5.76)。
  • ℂ 上:可交换 ⇒ 有公共特征向量(5.78)⇒ 可同时上三角化(5.80)⇒ 和与积的特征值可由各自的特征值相加、相乘得到(5.81)。
可交换commute$ST=TS$。算子可交换 ⇔ 它们关于同一组基的矩阵可交换(5.74)。
同时对角化simultaneous diagonalization存在一组基使两个算子的矩阵都是对角的;对可对角化算子,这等价于可交换(5.76)。
偏导数算子partial differentiation operator$D_w p=\partial p/\partial w$:对一个变量求导,把其他变量当常数;$D_wD_z=D_zD_w$。

$S,T$ 可交换,$v$ 是 $S$ 对应于特征值 5 的特征向量。关于 $Tv$,下面哪项一定成立?

本章小结

  • 主线:不变子空间 → 一维不变子空间 = 特征向量 → 把多项式代入算子 → 极小多项式 → 特征值 = 极小多项式的零点 → 用极小多项式的形状判断能否上三角化、能否对角化 → 两个可交换算子能被同时化简。
  • 特征向量:$Tv=\lambda v$,$v\ne0$;有限维时 $\lambda$ 是特征值 ⇔ $T-\lambda I$ 不可逆(5.7)。不同特征值的特征向量线性无关(5.11),所以特征值至多 $\dim V$ 个(5.12)。
  • $p(T)$:同一算子的多项式可交换(5.17);$\operatorname{null}p(T)$、$\operatorname{range}p(T)$ 是不变子空间(5.18);特征向量上 $p(T)v=p(\lambda)v$。
  • 存在性:ℂ 上必有特征值(5.19,靠代数基本定理);ℝ 上奇数维必有(5.34);ℝ 上偶数维可能没有(旋转)。
  • 极小多项式:唯一、次数 ≤ $\dim V$(5.22);$q(T)=0$ ⇔ $q$ 是它的倍式(5.29);不可逆 ⇔ 常数项为 0(5.32);实用算法:看 $v,Tv,T^2v,\dots$ 何时相关(5.25)。
  • 上三角:对角元 = 全部特征值(5.41);可上三角化 ⇔ 极小多项式是一次因式之积(5.44);ℂ 上总能做到(5.47)。
  • 对角化:⇔ 特征向量基 ⇔ 特征空间维数之和为 $\dim V$(5.55)⇔ 极小多项式是互异一次因式之积(5.62)。Gershgorin 圆盘圈住所有特征值(5.67)。
  • 可交换:保持彼此的特征空间(5.75);可对角化时可同时对角化 ⇔ 可交换(5.76);ℂ 上可同时上三角化(5.80)。
问题𝐅 = ℂ(有限维、非零)𝐅 = ℝ(有限维、非零)
一定有特征值吗?✓ 一定有(5.19)奇数维一定有(5.34);偶数维不一定(旋转 90°)
一定能上三角化吗?✓ 一定能(5.47)⇔ 极小多项式的零点全是实数(5.44)
一定能对角化吗?✗;⇔ 极小多项式没有重根(5.62)✗;⇔ 零点全为实数且没有重根(5.62)
特征值怎么「读」出来?上三角矩阵的对角线(5.41);一般只能求极小多项式的根——5 次以上通常只能数值近似(5.28)
全部算子 旋转 90°(ℝ) 例 5.43(ℝ) 可上三角化 剪切 [1 1; 0 1] 例 5.57、例 5.61 可对角化 例 5.51、例 5.59、 例 5.60(ℂ)、2I 𝐅 = ℂ 时,最外圈是空的:每个算子都可上三角化(5.47)
示意图(本教材绘制):可对角化 ⊂ 可上三角化 ⊂ 全部算子;区别全写在极小多项式里。

自测

前面各节里已有 9 道小题,这里再来几道综合题。

$T\in\mathcal{L}(\mathbf{R}^2)$ 是关于直线 $y=x$ 的反射。它的特征值是?

$\dim V=4$,$T\in\mathcal{L}(V)$。$T$ 的极小多项式的次数可能是 5 吗?

$T$ 关于某组基的矩阵是 diag(2, 2, 3)。$E(2,T)$ 的维数是多少?

$V$ 是有限维非零复向量空间,$ST=TS$。下列哪项一定成立?

习题

以下选自原书各节末的习题(编号为原书编号),每题附提示与完整解答。

5A.5设 $T\in\mathcal{L}(\mathbf{R}^2)$,$T(x,y)=(-3y,x)$。求 $T$ 的特征值。
提示写出 $T(x,y)=\lambda(x,y)$ 的方程组,仿照例 5.9 消元。
参考解答

$T(x,y)=\lambda(x,y)$ 即 $-3y=\lambda x$,$x=\lambda y$。把第二式代入第一式:$-3y=\lambda^2y$。若 $y=0$,则 $x=\lambda y=0$,得零向量,不算。所以 $y\ne0$,$\lambda^2=-3$,这在 ℝ 中无解。故 $T$ 没有(实)特征值。(几何上,$T$ 是「旋转 90° 并把两个方向按不同比例伸缩」,没有被保持的直线;若在 ℂ 上考虑,特征值为 $\pm\sqrt3\,i$。)

5A.8设 $P\in\mathcal{L}(V)$ 满足 $P^2=P$。证明:若 $\lambda$ 是 $P$ 的特征值,则 $\lambda=0$ 或 $\lambda=1$。
提示在特征向量上把 $P$ 换成 $\lambda$。
参考解答

设 $Pv=\lambda v$,$v\ne0$。则 $\lambda v=Pv=P^2v=P(\lambda v)=\lambda^2v$,即 $(\lambda^2-\lambda)v=0$。因 $v\ne0$,$\lambda^2-\lambda=\lambda(\lambda-1)=0$,所以 $\lambda=0$ 或 $1$。(换个说法:$z^2-z$ 能消灭 $P$,所以极小多项式整除 $z(z-1)$,零点只能是 0、1——5.27 与 5.29。)

5A.24设 $A$ 是 𝐅 上的 $n\times n$ 矩阵,定义 $T\in\mathcal{L}(\mathbf{F}^n)$ 为 $Tx=Ax$($x$ 看作列向量)。(a) 若 $A$ 每一行元素之和都等于 1,证明 1 是 $T$ 的特征值。(b) 若每一列元素之和都等于 1,证明 1 是 $T$ 的特征值。
提示(a) 试试全 1 向量。(b) 看 $A-I$ 的各行加起来等于什么。
参考解答

(a) 令 $x=(1,\dots,1)^{\mathsf T}\ne0$。$Ax$ 的第 $j$ 个分量是第 $j$ 行元素之和,等于 1,所以 $Ax=x$,1 是特征值。

(b) $A-I$ 的每一列元素之和都等于 $1-1=0$,这说明 $A-I$ 的 $n$ 个行向量相加等于零向量,所以这些行线性相关,$A-I$ 的行秩 $\lt n$。由于列秩等于行秩(原书 3.57),$A-I$ 的列也线性相关,于是存在非零 $x$ 使 $(A-I)x=0$,即 $Tx=x$。所以 1 是特征值。(这正是马尔可夫链有「稳态分布」的线性代数原因;前面幂迭代演示里的 [0.9 0.2; 0.1 0.8] 就是这样的矩阵。)

5A.26设 $T\in\mathcal{L}(V)$,且 $V$ 中每个非零向量都是 $T$ 的特征向量。证明 $T$ 是恒等算子的倍数。
提示对两个线性无关的向量 $u,w$,比较 $T(u+w)$ 的两种写法。
参考解答

对每个 $v\ne0$ 有数 $\lambda_v$ 使 $Tv=\lambda_vv$。只需证明 $\lambda_v$ 与 $v$ 无关。任取非零 $u,w$。

若 $u,w$ 线性相关,$w=cu$($c\ne0$),则 $Tw=cTu=c\lambda_uu=\lambda_uw$,故 $\lambda_w=\lambda_u$。

若 $u,w$ 线性无关,则 $u+w\ne0$,且 $\lambda_{u+w}(u+w)=T(u+w)=\lambda_uu+\lambda_ww$,即 $(\lambda_{u+w}-\lambda_u)u+(\lambda_{u+w}-\lambda_w)w=0$。由线性无关,$\lambda_u=\lambda_{u+w}=\lambda_w$。

所以存在一个共同的 $\lambda$ 使 $Tv=\lambda v$ 对所有 $v\ne0$ 成立,对 $v=0$ 也显然成立,即 $T=\lambda I$。(对照演示中的「数乘 2I」:每个方向都是特征方向。)

5B.3设整数 $n\gt1$,$T\in\mathcal{L}(\mathbf{F}^n)$,$T(x_1,\dots,x_n)=(x_1+\cdots+x_n,\ \dots,\ x_1+\cdots+x_n)$(矩阵元素全为 1)。(a) 求 $T$ 的全部特征值与特征向量;(b) 求 $T$ 的极小多项式。
提示记 $s(x)=x_1+\cdots+x_n$,则 $Tx=s(x)\,(1,\dots,1)$。算 $T^2$。
参考解答

记 $\mathbf 1=(1,\dots,1)$,$s(x)=x_1+\cdots+x_n$,则 $Tx=s(x)\mathbf 1$。

(a) 设 $Tx=\lambda x$,$x\ne0$。若 $s(x)=0$,则 $\lambda x=0$,故 $\lambda=0$:特征值 0 的特征向量是全部满足 $x_1+\cdots+x_n=0$ 的非零向量(这是 $n-1\ge1$ 维的 $\operatorname{null}T$)。若 $s(x)\ne0$,则 $x=\tfrac{s(x)}{\lambda}\mathbf 1$ 是 $\mathbf 1$ 的倍数,而 $T\mathbf 1=n\mathbf 1$,故 $\lambda=n$:特征值 $n$ 的特征向量是 $\mathbf 1$ 的非零倍数。所以特征值恰为 0 和 $n$。

(b) $T^2x=s(x)T\mathbf 1=s(x)\,n\mathbf 1=nTx$,所以 $T^2-nT=0$。$T$ 不是恒等算子的倍数(例如 $Te_1=\mathbf 1$ 不是 $e_1$ 的倍数),所以没有 1 次首一多项式能消灭它。故极小多项式为 $z^2-nz=z(z-n)$。它的零点 0、$n$ 正是 (a) 中的特征值(5.27);它是互异一次因式之积,所以 $T$ 可对角化(5.62)。(在计算器里选「全 1 矩阵」可验证 $n=3$ 的情形。)

5B.11设 $\dim V=2$,$T$ 关于某组基的矩阵为 $\begin{pmatrix}a & b\\ c & d\end{pmatrix}$。(a) 证明 $T^2-(a+d)T+(ad-bc)I=0$。(b) 证明:若 $b=c=0$ 且 $a=d$,则极小多项式为 $z-a$;否则为 $z^2-(a+d)z+(ad-bc)$。
提示(a) 直接计算矩阵。(b) 1 次首一多项式能消灭 $T$ 当且仅当 $T$ 是 $I$ 的倍数。
参考解答

(a) 记 $A$ 为该矩阵。$A^2=\begin{pmatrix}a^2+bc & ab+bd\\ ca+dc & cb+d^2\end{pmatrix}$,$(a+d)A=\begin{pmatrix}a^2+ad & ab+bd\\ ac+cd & ad+d^2\end{pmatrix}$,相减得 $A^2-(a+d)A=\begin{pmatrix}bc-ad & 0\\ 0 & bc-ad\end{pmatrix}=-(ad-bc)I$。所以 $T^2-(a+d)T+(ad-bc)I=0$。

(b) 若 $b=c=0$、$a=d$,则 $T=aI$,$z-a$ 消灭 $T$,它是 1 次首一多项式,次数不可能更低(0 次首一多项式是 1,$1(T)=I\ne0$),所以是极小多项式。否则 $T$ 不是 $I$ 的倍数(若 $T=\lambda I$,矩阵必为 $\lambda I$,即 $b=c=0,a=d=\lambda$),没有 1 次首一多项式能消灭它,极小多项式次数 ≥ 2;而 (a) 中的 2 次首一多项式能消灭 $T$,由唯一性(5.22)它就是极小多项式。

5C.4 · 5C.5(5C.4) 举出一个算子,它关于某组基的矩阵对角线上全是 0,但它可逆。(5C.5) 举出一个算子,它关于某组基的矩阵对角线上全不为 0,但它不可逆。
提示2×2 就够了。这两题说明 5.41 离不开「上三角」这个前提。
参考解答

(5C.4) $T(x,y)=(y,x)$,矩阵 $\begin{pmatrix}0 & 1\\ 1 & 0\end{pmatrix}$ 对角线全为 0;但 $T^2=I$,$T$ 可逆(逆就是它自己)。它的特征值是 $\pm1$,与对角元 0 无关。

(5C.5) $T(x,y)=(x+y,\ x+y)$,矩阵 $\begin{pmatrix}1 & 1\\ 1 & 1\end{pmatrix}$ 对角线全为 1;但 $T(1,-1)=0$,$T$ 不是单射,不可逆(0 是特征值)。

5C.6设 𝐅 = ℂ,$V$ 有限维,$T\in\mathcal{L}(V)$。证明:对每个 $k\in\{1,\dots,\dim V\}$,$V$ 都有一个 $k$ 维的 $T$-不变子空间。
提示5.47 + 5.39。
参考解答

由 5.47,存在基 $v_1,\dots,v_n$ 使 $T$ 的矩阵上三角。由 5.39 (b),每个 $\operatorname{span}(v_1,\dots,v_k)$ 都在 $T$ 下不变,而它的维数恰为 $k$(基向量线性无关)。(对比 ℝ:旋转 90° 在 ℝ² 中没有 1 维不变子空间。)

5D.1设 $V$ 是有限维复向量空间,$T\in\mathcal{L}(V)$。(a) 证明:若 $T^4=I$,则 $T$ 可对角化。(b) 证明:若 $T^4=T$,则 $T$ 可对角化。(c) 举出 $T\in\mathcal{L}(\mathbf{C}^2)$,使 $T^4=T^2$ 但 $T$ 不可对角化。
提示找一个能消灭 $T$ 的多项式,看它有没有重根;再用 5.29 与 5.62。
参考解答

(a) $q(z)=z^4-1=(z-1)(z+1)(z-i)(z+i)$ 满足 $q(T)=0$,所以极小多项式整除 $q$(5.29)。$q$ 是 4 个互异一次因式之积,它的首一因式也是互异一次因式之积,故由 5.62,$T$ 可对角化。

(b) $q(z)=z^4-z=z(z-1)(z-\omega)(z-\bar\omega)$,其中 $\omega=e^{2\pi i/3}$;四个零点 $0,1,\omega,\bar\omega$ 互不相同,同理可对角化。

(c) $T(x,y)=(y,0)$,矩阵 $\begin{pmatrix}0 & 1\\ 0 & 0\end{pmatrix}$。$T^2=0$,所以 $T^4=T^2=0$。但极小多项式是 $z^2$($T\ne0$),有重复因式,由 5.62 不可对角化(也可以直接看:唯一特征值 0 的特征空间只有 1 维)。注意 $z^4-z^2=z^2(z-1)(z+1)$ 本身就有重根 0,这正是 (c) 能构造反例的原因。

5D.21斐波那契数列:$F_0=0$,$F_1=1$,$F_n=F_{n-2}+F_{n-1}$($n\ge2$)。定义 $T\in\mathcal{L}(\mathbf{R}^2)$,$T(x,y)=(y,x+y)$。(a) 证明 $T^n(0,1)=(F_n,F_{n+1})$;(b) 求 $T$ 的特征值;(c) 求由特征向量组成的基;(d) 由此证明 $F_n=\frac{1}{\sqrt5}\Big[\big(\tfrac{1+\sqrt5}{2}\big)^n-\big(\tfrac{1-\sqrt5}{2}\big)^n\Big]$;(e) 证明 $F_n$ 是最接近 $\frac{1}{\sqrt5}\big(\tfrac{1+\sqrt5}{2}\big)^n$ 的整数。
提示仿照例 5.59:把 $(0,1)$ 写成特征向量的组合,再对每项乘上 $\lambda^n$。
参考解答

(a) 归纳:$n=0$ 时 $T^0(0,1)=(0,1)=(F_0,F_1)$。若 $T^n(0,1)=(F_n,F_{n+1})$,则 $T^{n+1}(0,1)=T(F_n,F_{n+1})=(F_{n+1},F_n+F_{n+1})=(F_{n+1},F_{n+2})$。

(b) $T(x,y)=\lambda(x,y)$ 即 $y=\lambda x$,$x+y=\lambda y$。若 $x=0$ 则 $y=0$,所以 $x\ne0$,代入得 $x+\lambda x=\lambda^2x$,$\lambda^2-\lambda-1=0$,$\lambda=\varphi=\tfrac{1+\sqrt5}{2}$ 或 $\lambda=\psi=\tfrac{1-\sqrt5}{2}$。

(c) 由 $y=\lambda x$,特征向量可取 $(1,\varphi)$ 与 $(1,\psi)$;两个互异特征值,所以它们构成 ℝ² 的基(5.58)。

(d) 因 $\varphi-\psi=\sqrt5$,有 $(0,1)=\tfrac{1}{\sqrt5}\big[(1,\varphi)-(1,\psi)\big]$。于是 $T^n(0,1)=\tfrac{1}{\sqrt5}\big[\varphi^n(1,\varphi)-\psi^n(1,\psi)\big]$,比较第一个分量并用 (a),得 $F_n=\tfrac{1}{\sqrt5}(\varphi^n-\psi^n)$。

(e) $|\psi|\approx0.618\lt1$,所以 $\big|\tfrac{\psi^n}{\sqrt5}\big|\le\tfrac{1}{\sqrt5}\lt\tfrac12$。于是 $F_n$ 与 $\tfrac{\varphi^n}{\sqrt5}$ 之差的绝对值小于 $\tfrac12$,而 $F_n$ 是整数,它就是最接近 $\tfrac{\varphi^n}{\sqrt5}$ 的整数。(幂迭代演示选「斐波那契」,可以看到 $T^k(0,1)$ 的方向趋于特征向量 $(1,\varphi)$。)

5D.22设 $A$ 是 $T\in\mathcal{L}(V)$ 关于某组基的 $n\times n$ 矩阵。证明:若对每个 $j$ 都有 $|A_{j,j}|\gt\sum_{k\ne j}|A_{j,k}|$(对角占优),则 $T$ 可逆。
提示0 在不在某个 Gershgorin 圆盘里?
参考解答

对每个 $j$,$|0-A_{j,j}|=|A_{j,j}|\gt\sum_{k\ne j}|A_{j,k}|$,所以 0 不在任何一个 Gershgorin 圆盘里。由 5.67,每个特征值都落在某个圆盘中,故 0 不是 $T$ 的特征值。由 5.7,$T-0I=T$ 可逆。

5E.4证明或举反例:若 $A$ 是对角矩阵、$B$ 是同阶上三角矩阵,则 $A$ 与 $B$ 可交换。
提示对角矩阵从左乘是「缩放各行」,从右乘是「缩放各列」。
参考解答

结论不成立。取 $A=\begin{pmatrix}1 & 0\\ 0 & 2\end{pmatrix}$,$B=\begin{pmatrix}0 & 1\\ 0 & 0\end{pmatrix}$。则 $AB=\begin{pmatrix}0 & 1\\ 0 & 0\end{pmatrix}$,$BA=\begin{pmatrix}0 & 2\\ 0 & 0\end{pmatrix}$,$AB\ne BA$。原因:$AB$ 把 $B$ 的第 $j$ 行乘以 $A_{j,j}$,$BA$ 把第 $k$ 列乘以 $A_{k,k}$;非对角元 $B_{j,k}$ 分别被乘以 $A_{j,j}$ 和 $A_{k,k}$,两者不等时就不可交换(对照习题 5D.13:对角元互异的对角矩阵只与对角矩阵可交换)。

5E.10举出有限维实向量空间上两个可交换算子 $S,T$ 的例子,使 $S+T$ 有一个不等于「$S$ 的特征值 + $T$ 的特征值」的特征值,且 $ST$ 有一个不等于「$S$ 的特征值 × $T$ 的特征值」的特征值。(这说明 5.81 在实向量空间上不成立。)
提示让 $S$、$T$ 干脆都没有实特征值。
参考解答

在 ℝ² 上取 $S=R$ 为逆时针旋转 90°,$T=-R$(顺时针旋转 90°)。$R^2=-I$,所以 $ST=-R^2=I=TS$,两者可交换。$S$、$T$ 都是旋转 90°,都没有实特征值(例 5.9)。但 $S+T=0$ 有特征值 0,$ST=I$ 有特征值 1——它们不可能写成「$S$ 的特征值 + / × $T$ 的特征值」,因为根本没有可用的特征值。

第 6 章

内积空间 Inner Product Spaces

前五章的向量空间只有「加法与数乘」,没有长度、没有角度。内积把几何带回来:长度、垂直、投影、最近点——并用它们解决「求最接近」的最小化问题(最佳逼近、最小二乘、伪逆)。

学习目标
  • 说清内积的五条性质,以及它如何产生长度(范数)与「垂直」(正交);知道复数情形为什么要取共轭
  • 会用「正交分解 + 勾股定理」这一招,理解 Cauchy–Schwarz 不等式、三角不等式与平行四边形恒等式,并说出何时取等号
  • 理解规范正交基为何好用(坐标 = 内积,长度² = 坐标平方和),会手算 Gram–Schmidt 过程
  • 理解 Riesz 表示定理:有限维内积空间上每个线性泛函都是「与某个固定向量做内积」
  • 掌握正交补 $U^\perp$、正交投影 $P_U$,以及「离 $v$ 最近的点就是 $P_Uv$」,并用它做函数逼近与最小二乘
  • 理解伪逆 $T^\dagger$:方程 $Tv=w$ 无解或解不唯一时,它给出「最佳近似解中范数最小的那一个」
一分钟速览
  • 内积 = 点积的推广:$\langle u,v\rangle$ 给出长度 $\|v\|=\sqrt{\langle v,v\rangle}$ 和「垂直」($\langle u,v\rangle=0$)。换一个内积,长度与垂直的含义就跟着变。
  • 全章的核心招式是正交分解:把 $u$ 拆成「沿 $v$ 的影子」加「垂直于 $v$ 的部分」,再用勾股定理——Cauchy–Schwarz、Bessel、最近点定理都这样证。
  • Cauchy–Schwarz:$|\langle u,v\rangle|\le\|u\|\,\|v\|$,只有 $u,v$ 共线时取等号;三角不等式由它推出。
  • 规范正交基下,坐标就是内积:$v=\sum\langle v,e_k\rangle e_k$,$\|v\|^2=\sum|\langle v,e_k\rangle|^2$——任何 $n$ 维内积空间都「长得像」$\mathbf{F}^n$。
  • Gram–Schmidt:逐个「减去在已有方向上的影子,再缩放成长度 1」,把任意线性无关组变成规范正交组,而且每一步张成的空间不变。
  • Riesz 表示定理:在有限维内积空间上,每个线性泛函 $\varphi$ 都等于 $u\mapsto\langle u,v\rangle$,$v$ 唯一,且垂直于 $\varphi$ 的所有等值线。
  • 正交补与投影:$U$ 有限维时 $V=U\oplus U^\perp$;$P_Uv$ 是 $U$ 中离 $v$ 最近的点——最佳多项式逼近、最小二乘拟合都是它。
  • 伪逆:$T^\dagger w$ = 先把 $w$ 投影到 $\operatorname{range}T$,再到 $(\operatorname{null}T)^\perp$ 里取原像;它让 $\|Tv-w\|$ 最小,且在所有最佳解中长度最短。
本章地图 6A 内积与范数 6B 规范正交基 6C 正交补与最小化 内积 ⟨u,v⟩6.2 五条性质 范数 · 正交 · 勾股6.7 · 6.10 · 6.12 正交分解 u = cv + w6.13 全章核心招式 Cauchy–Schwarz三角不等式 · 平行四边形6.14 · 6.17 · 6.21 规范正交组 · Bessel6.22 – 6.26 Gram–Schmidt 过程6.32 → Schur 6.38 规范正交基6.30 坐标 = 内积 Riesz 表示定理φ(u) = ⟨u,v⟩6.42 · 6.58 正交补 · V = U ⊕ U⊥6.46 · 6.49 · 6.52 正交投影 PU6.55 · 6.57 最近点 = 正交投影6.61 最佳逼近 · 最小二乘 伪逆 T†最佳近似解 · 最小范数6.67 – 6.70

点击方框跳到对应内容;箭头表示「用到 / 推出」。三列从上到下大致就是原书的顺序,而「正交分解」这一招贯穿了三节。

6A 内积与范数 Inner Products and Norms

定义向量空间时,我们只从 $\mathbf{R}^2$、$\mathbf{R}^3$ 里抽象出了「加法」和「数乘」,完全忽略了长度和角度。这一节要回答:怎样在抽象的向量空间里谈长度、谈垂直?答案是再给空间配上一件工具——内积。有了它,勾股定理、Cauchy–Schwarz 不等式、三角不等式、平行四边形恒等式这些几何事实都会自动成立。

本章约定 (standing assumptions for this chapter) $\mathbf{F}$ 表示 $\mathbf{R}$ 或 $\mathbf{C}$;$V$、$W$ 是 $\mathbf{F}$ 上的向量空间。从 6.5 起,$V$、$W$ 都默认是内积空间(这个约定一直沿用到第 7 章)。

内积 Inner Products

先从最熟悉的地方出发。把 $\mathbf{R}^2$ 中的向量看成从原点出发的箭头,$v=(a,b)$ 的长度(范数(norm))是 $\|v\|=\sqrt{a^2+b^2}$;推广到 $\mathbf{R}^n$ 就是 $\|x\|=\sqrt{x_1^2+\cdots+x_n^2}$。长度本身不是线性的($\|x+y\|\ne\|x\|+\|y\|$),为了把「线性」带进来,我们请出点积。

定义点积dot product6.1

对 $x,y\in\mathbf{R}^n$,定义 $x\cdot y=x_1y_1+\cdots+x_ny_n$。它是一个数(不是向量),并且 $x\cdot x=\|x\|^2$。

点积有四条性质:$x\cdot x\ge 0$;$x\cdot x=0$ 当且仅当 $x=0$;固定 $y$ 时,$x\mapsto x\cdot y$ 是线性的;$x\cdot y=y\cdot x$。

直觉:点积 = 影子长度 × 另一个向量的长度 在 $\mathbf{R}^2$ 中有 $x\cdot y=\|x\|\,\|y\|\cos\theta$($\theta$ 是两箭头的夹角,见习题 6A.15)。所以点积量的是「$x$ 在 $y$ 方向上投下的影子有多长」再乘以 $\|y\|$:同向时最大,垂直时为 0,反向时为负。整章的几何,都藏在这个「影子」里。

复数情形要多一步。对 $\lambda=a+bi$,有 $|\lambda|^2=\lambda\overline{\lambda}$。于是 $z\in\mathbf{C}^n$ 的长度平方是 $\|z\|^2=z_1\overline{z_1}+\cdots+z_n\overline{z_n}$。这提示我们:$w$ 与 $z$ 的内积应该是 $w_1\overline{z_1}+\cdots+w_n\overline{z_n}$——交换 $w$、$z$ 的位置,结果变成它的共轭。把这些观察抽象出来,就得到内积的定义。

定义内积inner product6.2

$V$ 上的内积是一个函数:把每一对 $(u,v)$ 送到一个数 $\langle u,v\rangle\in\mathbf{F}$,并满足下面五条(对复数 $\lambda$,记号 $\lambda\ge0$ 表示 $\lambda$ 是非负实数):

名称内容一句话直觉
正性 positivity$\langle v,v\rangle\ge 0$自己和自己的内积是「长度平方」,不能为负
定性 definiteness$\langle v,v\rangle=0\iff v=0$只有零向量的长度为 0
第一位可加 additivity in first slot$\langle u+v,w\rangle=\langle u,w\rangle+\langle v,w\rangle$固定第二个向量,内积对第一个向量是线性的
第一位齐次 homogeneity in first slot$\langle \lambda u,v\rangle=\lambda\langle u,v\rangle$
共轭对称 conjugate symmetry$\langle u,v\rangle=\overline{\langle v,u\rangle}$实空间里就是对称:$\langle u,v\rangle=\langle v,u\rangle$
两种约定 大多数数学家(包括 Axler)要求内积对第一个位置齐次;很多物理学家则要求对第二个位置齐次。读其他书时注意分辨,结论相同,只是共轭出现的位置不同。
例几种内积inner products6.3
  1. 欧氏内积(Euclidean inner product):在 $\mathbf{F}^n$ 上 $\langle (w_1,\dots,w_n),(z_1,\dots,z_n)\rangle=w_1\overline{z_1}+\cdots+w_n\overline{z_n}$。以后说「$\mathbf{F}^n$ 是内积空间」,默认就是它。
  2. 加权内积:取正数 $c_1,\dots,c_n$,令 $\langle w,z\rangle=c_1w_1\overline{z_1}+\cdots+c_nw_n\overline{z_n}$。(下面的演示可以切换到它,看「长度」与「垂直」怎样随之改变。)
  3. 区间 $[-1,1]$ 上的连续实函数:$\langle f,g\rangle=\int_{-1}^{1}fg$。
  4. $\mathcal{P}(\mathbf{R})$ 上:$\langle p,q\rangle=p(0)q(0)+\int_{-1}^{1}p'q'$。
  5. $\mathcal{P}(\mathbf{R})$ 上:$\langle p,q\rangle=\int_{0}^{\infty}p(x)q(x)e^{-x}\,dx$。
直觉:函数也能「做点积」 把 $f$、$g$ 在 $[-1,1]$ 上密密地取 $N$ 个样点,得到两个很长的向量;它们的点积(再乘以间距)就近似 $\int_{-1}^1 fg$。所以 (c) 就是「有无穷多个分量的点积」。验证一个候选公式是不是内积,最要紧的是定性:例如 (d) 中若 $\langle p,p\rangle=p(0)^2+\int_{-1}^1 (p')^2=0$,则 $p'=0$ 且 $p(0)=0$,于是 $p=0$——少了 $p(0)q(0)$ 这一项,常数多项式就会「长度为 0」,定性就失败了。
定义内积空间;记号 V、Winner product space6.46.5

内积空间就是一个向量空间 $V$ 连同它上面的一个内积。从现在起(本章和下一章),$V$、$W$ 都表示 $\mathbf{F}$ 上的内积空间;如果空间是 $\mathbf{F}^n$ 而没有特别说明,内积就是欧氏内积。

命题内积的基本性质basic properties of an inner product6.6
  1. 固定 $v$,映射 $u\mapsto\langle u,v\rangle$ 是从 $V$ 到 $\mathbf{F}$ 的线性映射(一个线性泛函,6B 的 Riesz 定理会说:所有线性泛函都长这样);
  2. $\langle 0,v\rangle=0$;
  3. $\langle v,0\rangle=0$;
  4. $\langle u,v+w\rangle=\langle u,v\rangle+\langle u,w\rangle$;
  5. $\langle u,\lambda v\rangle=\overline{\lambda}\,\langle u,v\rangle$。
证明思路

(a) 就是定义里「第一位可加、齐次」。(b) 线性映射把 0 送到 0。(c)(d)(e) 都是先用共轭对称把向量换到第一个位置,用第一位的线性,再换回来:例如 $\langle u,\lambda v\rangle=\overline{\langle\lambda v,u\rangle}=\overline{\lambda\langle v,u\rangle}=\overline{\lambda}\,\overline{\langle v,u\rangle}=\overline{\lambda}\langle u,v\rangle$。

常见误区:第二个位置要取共轭 在复内积空间中,$\langle u,\lambda v\rangle=\overline{\lambda}\langle u,v\rangle$,不是 $\lambda\langle u,v\rangle$。例如 $\langle u,iv\rangle=-i\langle u,v\rangle$。实空间里 $\overline{\lambda}=\lambda$,这个区别消失,所以只在复数情形需要小心。

在复内积空间中,$\langle 2iu,\;3iv\rangle$ 等于多少?

范数 Norms

我们最初是为了「长度」才引入内积的;反过来,每个内积都自动给出一种长度。

定义范数norm, ‖v‖6.7

对 $v\in V$,定义它的范数 $\|v\|=\sqrt{\langle v,v\rangle}$。

例 6.8:在 $\mathbf{F}^n$ 中 $\|(z_1,\dots,z_n)\|=\sqrt{|z_1|^2+\cdots+|z_n|^2}$;在 6.3(c) 的函数空间中 $\|f\|=\sqrt{\int_{-1}^1 f^2}$。

命题范数的基本性质basic properties of the norm6.9

(a) $\|v\|=0\iff v=0$;  (b) $\|\lambda v\|=|\lambda|\,\|v\|$。

证明思路

(a) 来自定性。(b) 算平方:$\|\lambda v\|^2=\langle\lambda v,\lambda v\rangle=\lambda\overline{\lambda}\langle v,v\rangle=|\lambda|^2\|v\|^2$,再开方。

小技巧处理范数时,先算范数的平方往往容易得多——因为平方就是内积,可以按线性展开。后面几乎每个证明都用这一招。

正交与勾股定理

定义正交orthogonal6.10

若 $\langle u,v\rangle=0$,就称 $u,v$ 正交(也说 $u$ 与 $v$ 正交)。顺序无关,因为 $\langle u,v\rangle=0\iff\langle v,u\rangle=0$。

在 $\mathbf{R}^2$ 中 $\langle u,v\rangle=\|u\|\,\|v\|\cos\theta$,所以两个非零向量正交 $\iff\cos\theta=0\iff$ 它们在通常意义下垂直。可以把「正交」当作「垂直」的高级说法(orthogonal 源自希腊语 orthogonios,意为「直角的」)。原书还记了一段趣事:2010 年一位律师在美国最高法院说某个问题与本案「orthogonal」,法官们追问这个词,最后 Scalia 大法官赞叹:「Orthogonal, ooh.」——引得满堂笑声。

命题正交与 0orthogonality and 06.11

(a) $0$ 与每个向量正交;(b) $0$ 是唯一与自身正交的向量(因为 $\langle v,v\rangle=0\Rightarrow v=0$)。

定理勾股定理Pythagorean theorem6.12

若 $u,v$ 正交,则 $\|u+v\|^2=\|u\|^2+\|v\|^2$。

证明思路

展开:$\|u+v\|^2=\langle u+v,u+v\rangle=\langle u,u\rangle+\langle u,v\rangle+\langle v,u\rangle+\langle v,v\rangle$,中间两项为 0。$\mathbf{R}^2$ 中这个定理早在 3500 多年前就为巴比伦人所知——而这里的证明只有一行,并且对任何内积空间(包括函数空间)都成立。

正交分解:全章的核心招式

给定 $v\ne0$,我们想把任意 $u$ 拆成「$v$ 的倍数」加「与 $v$ 垂直的向量」。设 $u=cv+(u-cv)$,要求 $u-cv$ 与 $v$ 正交:

$$0=\langle u-cv,\,v\rangle=\langle u,v\rangle-c\|v\|^2\quad\Longrightarrow\quad c=\frac{\langle u,v\rangle}{\|v\|^2}.$$
命题正交分解an orthogonal decomposition6.13

设 $v\ne0$,令 $c=\dfrac{\langle u,v\rangle}{\|v\|^2}$,$w=u-cv$。则 $u=cv+w$ 且 $\langle w,v\rangle=0$。

直觉:影子 + 垂线 $cv$ 是 $u$ 在直线 $\operatorname{span}(v)$ 上的影子(光线垂直照向这条直线),$w$ 是从影子指回 $u$ 的垂线。系数 $c$ 的分子 $\langle u,v\rangle$ 量影子有多长,分母 $\|v\|^2$ 把 $v$ 自身的长度「除掉」。这一招会反复出现:Cauchy–Schwarz(6.14)、Bessel 不等式(6.26)、Gram–Schmidt(6.32)、正交投影(6.55)都是它的变体。

Cauchy–Schwarz 不等式

定理Cauchy–Schwarz 不等式Cauchy–Schwarz inequality6.14
$$|\langle u,v\rangle|\le\|u\|\,\|v\|$$

等号成立当且仅当 $u,v$ 中有一个是另一个的标量倍(即二者共线)。

证明思路:正交分解 + 勾股定理

$v=0$ 时两边都是 0。设 $v\ne0$,用 6.13 写 $u=cv+w$,$w\perp v$。由勾股定理

$$\|u\|^2=|c|^2\|v\|^2+\|w\|^2=\frac{|\langle u,v\rangle|^2}{\|v\|^2}+\|w\|^2\ \ge\ \frac{|\langle u,v\rangle|^2}{\|v\|^2}.$$6.15

两边乘 $\|v\|^2$ 再开方即得。等号 $\iff\|w\|=0\iff u$ 是 $v$ 的倍数。一句话:斜边不短于直角边——$u$ 本身不短于它的影子。

几何上,这就是 $|\cos\theta|\le 1$:影子永远不会比向量本身更长。反过来,在画不出图的 $\mathbf{R}^n$($n\gt3$)里,人们干脆用它来定义夹角:$\theta=\arccos\frac{\langle x,y\rangle}{\|x\|\,\|y\|}$——正是 Cauchy–Schwarz 保证了分数落在 $[-1,1]$ 里,这个定义才有意义(习题 6A.16)。它的威力在于对一切内积空间都成立,所以一句话就能推出许多看起来毫不相干的不等式:

例Cauchy–Schwarz 的两个化身example: Cauchy–Schwarz inequality6.16

(a) 对实数 $x_k,y_k$:$(x_1y_1+\cdots+x_ny_n)^2\le(x_1^2+\cdots+x_n^2)(y_1^2+\cdots+y_n^2)$(用欧氏内积)。

(b) 对 $[-1,1]$ 上的连续实函数:$\left|\int_{-1}^1 fg\right|^2\le\left(\int_{-1}^1 f^2\right)\left(\int_{-1}^1 g^2\right)$(用 6.3(c) 的内积)。

历史:Cauchy 在 1821 年证明了 (a);他的学生 Bunyakovsky 在 1859 年证明了 (b) 这类积分不等式;几十年后 Schwarz 的类似发现流传更广,这个不等式因此以 Cauchy 和 Schwarz 命名。

拖动 u、v:内积、夹角与正交分解

拖动蓝色 $u$ 与红色 $v$ 的箭头尖(吸附到 0.25 的网格)。绿色是 $u$ 在 $v$ 方向上的影子 $cv$,紫色虚线是垂直部分 $w=u-cv$;灰色虚线是「单位球」$\{x:\langle x,x\rangle=1\}$。下方条形比较 $|\langle u,v\rangle|$ 与 $\|u\|\,\|v\|$。这是原书第 188 页插图的可动版本。

① $\langle u,v\rangle$ 的正负由夹角决定:锐角为正、钝角为负、直角为 0。② 条形里 $|\langle u,v\rangle|$ 永远不超过 $\|u\|\,\|v\|$,只有把 $u$ 拖到 $v$ 所在直线上(或按「让 u ∥ v」)时两条才一样长——这就是 Cauchy–Schwarz 的取等条件。③ 「让 u ⟂ v」其实就是把 $u$ 换成 $w=u-cv$:去掉影子,剩下的必然垂直。④ 切换到加权内积:单位球变成椭圆,$w$ 在图上看起来不再垂直于 $v$,但按新内积 $\langle w,v\rangle=0$ 仍成立——「垂直」是由内积定义的,不是由眼睛定义的。

三角不等式

定理三角不等式triangle inequality6.17
$$\|u+v\|\le\|u\|+\|v\|$$

等号成立当且仅当 $u,v$ 中有一个是另一个的非负实数倍(同向)。

证明思路:展开平方,再用 Cauchy–Schwarz
$$\begin{aligned}\|u+v\|^2 & = \|u\|^2+\|v\|^2+2\operatorname{Re}\langle u,v\rangle\\ & \le \|u\|^2+\|v\|^2+2|\langle u,v\rangle| & & (6.18)\\ & \le \|u\|^2+\|v\|^2+2\|u\|\,\|v\| & & (6.19)\\ & = (\|u\|+\|v\|)^2.\end{aligned}$$

第一行用了 $\langle u,v\rangle+\langle v,u\rangle=\langle u,v\rangle+\overline{\langle u,v\rangle}=2\operatorname{Re}\langle u,v\rangle$;(6.19) 就是 Cauchy–Schwarz。等号要求 (6.18)(6.19) 同时取等,即 $\langle u,v\rangle=\|u\|\,\|v\|$ 6.20:由 Cauchy–Schwarz 的取等条件,一个是另一个的标量倍;再由 6.20,这个标量必须是非负实数。

几何意义:三角形任一边短于另两边之和;推论是「两点之间,折线不如直线短」。反向的版本 $\big|\|u\|-\|v\|\big|\le\|u-v\|$ 见习题 6A.20。

平行四边形恒等式

定理平行四边形恒等式parallelogram equality6.21
$$\|u+v\|^2+\|u-v\|^2=2\left(\|u\|^2+\|v\|^2\right)$$

几何意义:平行四边形两条对角线的平方和,等于四条边的平方和。(以 $u,v$ 为邻边的平行四边形,对角线正是 $u+v$ 与 $u-v$。)

证明思路

把两个平方分别展开:$\|u\pm v\|^2=\|u\|^2+\|v\|^2\pm\big(\langle u,v\rangle+\langle v,u\rangle\big)$,相加时交叉项正负抵消。比欧氏几何里的传统证明直接得多。

直觉:这是「内积范数」的指纹 任何满足「$\|u\|=0\iff u=0$、$\|\alpha u\|=|\alpha|\,\|u\|$、三角不等式」的函数都叫范数,但只有满足平行四边形恒等式的范数才来自某个内积(习题 6A.28);在实空间里还能用「极化恒等式」$\langle u,v\rangle=\frac{1}{4}\big(\|u+v\|^2-\|u-v\|^2\big)$ 把内积还原出来(习题 6A.26)。所以像 $\max\{|x|,|y|\}$ 这样的「方形范数」就不来自任何内积(习题 6A.24)——下面的演示可以亲眼看到恒等式在它身上失效。
三角不等式与平行四边形恒等式

拖动蓝色 $u$、红色 $v$ 的箭头尖。下方把不等式/恒等式两边的数量画成条形。在「平行四边形」模式下可以把范数换成 max 范数或 ℓ¹ 范数(图中灰色虚线是相应的单位球),看看恒等式还成不成立。原书第 190、191 页插图的可动版本。

三角不等式:绿色条 $\|u+v\|$ 总比「蓝 + 红」短,只有 $v$ 与 $u$ 同向时(三角形压扁成线段)两者等长;反向时差距最大。平行四边形恒等式:用欧氏范数时,上下两条永远一样长,不管平行四边形多扁;换成 max 范数或 ℓ¹ 范数后,一般就对不齐了(试试 $u=(2,0)$、$v=(0,2)$)——这些范数不来自任何内积。

在实内积空间中,若 $\|u+v\|=\|u-v\|$,可以推出什么?

Cauchy–Schwarz 不等式 $|\langle u,v\rangle|\le\|u\|\,\|v\|$ 在什么情况下取等号?

点积dot product$x\cdot y=x_1y_1+\cdots+x_ny_n$;几何上等于 $\|x\|\,\|y\|\cos\theta$。
内积inner product满足正性、定性、第一位线性、共轭对称的函数 $(u,v)\mapsto\langle u,v\rangle\in\mathbf{F}$。
内积空间inner product space向量空间连同它上面的一个内积;$\mathbf{F}^n$ 默认配欧氏内积。
共轭对称conjugate symmetry$\langle u,v\rangle=\overline{\langle v,u\rangle}$;因此第二个位置是共轭线性的:$\langle u,\lambda v\rangle=\overline{\lambda}\langle u,v\rangle$。
范数norm$\|v\|=\sqrt{\langle v,v\rangle}$,由内积诱导的「长度」。
正交orthogonal$\langle u,v\rangle=0$;在 $\mathbf{R}^2$、$\mathbf{R}^3$ 中就是垂直。
正交分解orthogonal decomposition$u=cv+w$,$c=\langle u,v\rangle/\|v\|^2$,$w\perp v$:影子加垂线。
Cauchy–Schwarz 不等式Cauchy–Schwarz inequality$|\langle u,v\rangle|\le\|u\|\,\|v\|$,共线时取等号。
三角不等式triangle inequality$\|u+v\|\le\|u\|+\|v\|$,同向(非负实数倍)时取等号。
平行四边形恒等式parallelogram equality$\|u+v\|^2+\|u-v\|^2=2(\|u\|^2+\|v\|^2)$:对角线平方和 = 四边平方和。
本节要点
  • 内积 = 正性 + 定性 + 第一位线性 + 共轭对称;它诱导范数 $\|v\|=\sqrt{\langle v,v\rangle}$ 与「正交」。
  • 复数情形第二个位置取共轭:$\langle u,\lambda v\rangle=\overline\lambda\langle u,v\rangle$。
  • 正交分解 $u=\frac{\langle u,v\rangle}{\|v\|^2}v+w$ 配合勾股定理,推出 Cauchy–Schwarz(共线取等)与三角不等式(同向取等)。
  • 平行四边形恒等式对所有「来自内积的范数」成立,也只对它们成立。

6B 规范正交基 Orthonormal Bases

这一节要回答:什么样的基最好用?答案是「两两垂直、长度都是 1」的基。在这样的基下,求坐标只要做内积,算长度只要把坐标平方相加——任何 $n$ 维内积空间都变得和 $\mathbf{F}^n$ 一样好算。随后 Gram–Schmidt 过程保证:这样的基总能造出来。

规范正交组与 Gram–Schmidt 过程 Orthonormal Lists and the Gram–Schmidt Procedure

定义规范正交orthonormal6.22

向量组 $e_1,\dots,e_m$ 称为规范正交的,如果每个向量的范数都是 1,且与组内其他向量都正交。也就是

$$\langle e_j,e_k\rangle=\begin{cases}1, & j=k,\\ 0, & j\ne k.\end{cases}$$

「规范」(normal) 指长度为 1,「正交」(ortho) 指两两垂直。中文也常译作「标准正交」。

例规范正交组orthonormal lists6.23
  1. $\mathbf{F}^n$ 的标准基是规范正交组。
  2. $\left(\tfrac{1}{\sqrt3},\tfrac{1}{\sqrt3},\tfrac{1}{\sqrt3}\right),\left(-\tfrac{1}{\sqrt2},\tfrac{1}{\sqrt2},0\right)$ 是 $\mathbf{F}^3$ 中的规范正交组;
  3. 再添上 $\left(\tfrac{1}{\sqrt6},\tfrac{1}{\sqrt6},-\tfrac{2}{\sqrt6}\right)$ 仍然规范正交。
  4. 在 $C[-\pi,\pi]$(内积 $\langle f,g\rangle=\int_{-\pi}^{\pi}fg$)中,$\frac{1}{\sqrt{2\pi}},\frac{\cos x}{\sqrt\pi},\dots,\frac{\cos nx}{\sqrt\pi},\frac{\sin x}{\sqrt\pi},\dots,\frac{\sin nx}{\sqrt\pi}$ 是规范正交组(习题 6B.4),常用来刻画潮汐这类周期现象——这就是 Fourier 级数的出发点。
  5. 在 $\mathcal{P}_2(\mathbf{R})$(内积 $\int_{-1}^1pq$)中,$1,x,x^2$ 不是规范正交组;各自除以范数得 $\frac{1}{\sqrt2},\sqrt{\frac32}x,\sqrt{\frac52}x^2$,长度都是 1,第二个与另两个正交,但第一个与第三个不正交。怎样把它「修」成规范正交组,见例 6.34。
命题规范正交组合的范数norm of an orthonormal linear combination6.24

若 $e_1,\dots,e_m$ 规范正交,则对任意 $a_1,\dots,a_m\in\mathbf{F}$:$\ \|a_1e_1+\cdots+a_me_m\|^2=|a_1|^2+\cdots+|a_m|^2$。

这是 $m$ 维的勾股定理:每个 $a_ke_k$ 两两垂直,反复用 6.12 即得。

推论规范正交组线性无关orthonormal lists are linearly independent6.25

若 $a_1e_1+\cdots+a_me_m=0$,由 6.24 得 $|a_1|^2+\cdots+|a_m|^2=0$,所以所有 $a_k=0$。

定理Bessel 不等式Bessel’s inequality6.26

若 $e_1,\dots,e_m$ 规范正交,则对任意 $v\in V$:

$$|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_m\rangle|^2\le\|v\|^2.$$
证明思路:还是「影子 + 垂线」

令 $u=\langle v,e_1\rangle e_1+\cdots+\langle v,e_m\rangle e_m$($v$ 在 $\operatorname{span}(e_1,\dots,e_m)$ 上的影子),$w=v-u$。对每个 $k$,$\langle w,e_k\rangle=\langle v,e_k\rangle-\langle v,e_k\rangle\langle e_k,e_k\rangle=0$,所以 $w\perp u$。由勾股定理 $\|v\|^2=\|u\|^2+\|w\|^2\ge\|u\|^2$,再用 6.24 算 $\|u\|^2$ 即得。

直觉 $|\langle v,e_k\rangle|$ 是 $v$ 在第 $k$ 个方向上的影子长度。Bessel 说:在几个互相垂直的方向上的影子,平方加起来也不会超过本体的长度平方。只取一个方向($m=1$)时,它就是单位向量版本的 Cauchy–Schwarz。等号成立当且仅当 $v$ 落在 $\operatorname{span}(e_1,\dots,e_m)$ 里(习题 6B.3)——方向「够用」时,影子就是本体。
定义规范正交基orthonormal basis6.27

$V$ 的规范正交基是一个同时也是基的规范正交组。例如标准基是 $\mathbf{F}^n$ 的规范正交基。

配套结论 6.28:若 $V$ 有限维,则长度等于 $\dim V$ 的规范正交组一定是规范正交基(它线性无关,长度又对,由 2.38 即得)。

例𝐅⁴ 的一组规范正交基an orthonormal basis of 𝐅⁴6.29

下面四个向量(每个分量都是 $\pm\frac12$)构成 $\mathbf{F}^4$ 的规范正交基:

第 1 分量第 2 分量第 3 分量第 4 分量
$e_1$$\tfrac12$$\tfrac12$$\tfrac12$$\tfrac12$
$e_2$$\tfrac12$$\tfrac12$$-\tfrac12$$-\tfrac12$
$e_3$$\tfrac12$$-\tfrac12$$-\tfrac12$$\tfrac12$
$e_4$$-\tfrac12$$\tfrac12$$-\tfrac12$$\tfrac12$

每个向量的范数是 $\sqrt{4\cdot\frac14}=1$;任取两个,恰有两个位置符号相同、两个位置相反,所以内积 $=\frac14+\frac14-\frac14-\frac14=0$。长度为 4 的规范正交组,由 6.28 就是基。

对一般的基,求 $v=a_1e_1+\cdots+a_ne_n$ 中的系数要解一个线性方程组;对规范正交基,下一个结果说:直接做内积 $a_k=\langle v,e_k\rangle$ 就行。

定理用规范正交基展开向量writing a vector as a linear combination of an orthonormal basis6.30

设 $e_1,\dots,e_n$ 是 $V$ 的规范正交基,$u,v\in V$。则

$$\text{(a)}\ \ v=\langle v,e_1\rangle e_1+\cdots+\langle v,e_n\rangle e_n;\qquad \text{(b)}\ \ \|v\|^2=|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_n\rangle|^2;$$

(c) $\langle u,v\rangle=\langle u,e_1\rangle\overline{\langle v,e_1\rangle}+\cdots+\langle u,e_n\rangle\overline{\langle v,e_n\rangle}$。

证明思路

写 $v=a_1e_1+\cdots+a_ne_n$,两边与 $e_k$ 做内积:由规范正交性,右边只剩 $a_k$,所以 $a_k=\langle v,e_k\rangle$,这就是 (a)。(b) 由 (a) 和 6.24 得到。(c):用 $u$ 与 (a) 的两边做内积,再利用第二个位置的共轭线性(6.6(d)(e))。

直觉:任何 n 维内积空间都「长得像」𝐅ⁿ (b) 叫 Parseval 恒等式(Parseval’s identity),1799 年在 Fourier 级数的背景下发表。三条合起来说:只要选定一组规范正交基,把 $v$ 换成它的「坐标」$(\langle v,e_1\rangle,\dots,\langle v,e_n\rangle)$,长度、内积的计算就和 $\mathbf{F}^n$ 里的欧氏计算一模一样。规范正交基就是内积空间里的「直角坐标系」。
例四次内积代替解方程finding coefficients for a linear combination6.31

要把 $(1,2,4,7)$ 写成例 6.29 中那组基的线性组合,不必解 4 元方程组,只需算四个内积:$\langle(1,2,4,7),e_1\rangle=\frac{1+2+4+7}{2}=7$,同理得 $-4,\ 1,\ 2$。所以

$(1,2,4,7)=7e_1-4e_2+e_3+2e_4$。

规范正交基下:坐标 = 内积 = 垂足

拖动红色 $v$;拖动蓝色 $e_1$ 的箭头尖(或用滑块)旋转整组规范正交基,绿色 $e_2$ 始终与 $e_1$ 垂直。从 $v$ 向两条坐标轴作垂线,垂足正是 $\langle v,e_1\rangle e_1$ 与 $\langle v,e_2\rangle e_2$。勾选「对比:斜基」看看不垂直的基会出什么问题。

规范正交基下,两条垂线的垂足合成的矩形对角线恰好是 $v$:坐标就是影子,而且 $\|v\|^2$ 永远等于两个坐标的平方和(Parseval),不管基转到哪里。改成斜基后,真正的坐标要按「平行四边形法则」量取(琥珀色折线),而垂足(空心点)给出的 $\langle v,b_k\rangle$ 不再是坐标,坐标平方和也不再等于 $\|v\|^2$——这正是我们偏爱规范正交基的原因。勾选「反射」得到的是另一类规范正交基(习题 6B.2:$\mathbf{R}^2$ 的规范正交基不是旋转就是反射)。

Gram–Schmidt 过程

规范正交基这么好用,怎么造出来?比如带内积 $\int_{-1}^1pq$ 的 $\mathcal{P}_m(\mathbf{R})$ 有没有规范正交基?下面的算法给出肯定回答。它由 Gram(1850–1916)与 Schmidt(1876–1959)推广开来,能把任何线性无关组变成规范正交组,并且保持每一步张成的空间不变。

算法Gram–Schmidt 过程Gram–Schmidt procedure6.32

设 $v_1,\dots,v_m$ 线性无关。令 $f_1=v_1$,对 $k=2,\dots,m$ 依次定义

$$f_k=v_k-\frac{\langle v_k,f_1\rangle}{\|f_1\|^2}f_1-\cdots-\frac{\langle v_k,f_{k-1}\rangle}{\|f_{k-1}\|^2}f_{k-1},\qquad e_k=\frac{f_k}{\|f_k\|}.$$

则 $e_1,\dots,e_m$ 是规范正交组,并且对每个 $k$ 都有 $\operatorname{span}(v_1,\dots,v_k)=\operatorname{span}(e_1,\dots,e_k)$。

证明思路(对 k 归纳)

假设 $e_1,\dots,e_{k-1}$ 已经规范正交且 $\operatorname{span}(v_1,\dots,v_{k-1})=\operatorname{span}(e_1,\dots,e_{k-1})$ 6.33。

① 不会除以 0:$v_k\notin\operatorname{span}(v_1,\dots,v_{k-1})=\operatorname{span}(f_1,\dots,f_{k-1})$,而 $f_k$ 是 $v_k$ 减去这个子空间里的向量,所以 $f_k\ne0$。

② 新向量与旧的都垂直:对 $j\lt k$,把 $f_k$ 的定义代入 $\langle f_k,f_j\rangle$,由于 $f_1,\dots,f_{k-1}$ 两两正交,只剩 $\langle v_k,f_j\rangle-\langle v_k,f_j\rangle=0$。

③ 张成不变:由定义 $v_k\in\operatorname{span}(e_1,\dots,e_k)$,结合 6.33 得 $\operatorname{span}(v_1,\dots,v_k)\subseteq\operatorname{span}(e_1,\dots,e_k)$;两边都是 $k$ 维(都线性无关),所以相等。

直觉:减去影子,剩下的就垂直 每一步都是 6.13 正交分解的推广:$\frac{\langle v_k,f_j\rangle}{\|f_j\|^2}f_j=\langle v_k,e_j\rangle e_j$ 正是 $v_k$ 在方向 $e_j$ 上的影子。把 $v_k$ 在所有已有方向上的影子统统减掉,剩下的 $f_k$ 自然与它们全都垂直;再把 $f_k$ 缩放到长度 1 就得到 $e_k$。等价的写法是 $f_k=v_k-\langle v_k,e_1\rangle e_1-\cdots-\langle v_k,e_{k-1}\rangle e_{k-1}$。
Gram–Schmidt 逐步演示(ℝ³)

用「下一步 →」逐步执行;在图上按住拖动可以旋转视角。淡色箭头是原来的 $v_1,v_2,v_3$;蓝、绿、紫依次是 $e_1,e_2,e_3$;虚线是被减掉的「影子」和垂线。可以换一组预设向量,或随机生成。

第 0 步:出发

三个线性无关的向量 $v_1,v_2,v_3$。目标:找到规范正交的 $e_1,e_2,e_3$,并且 $\operatorname{span}(e_1)=\operatorname{span}(v_1)$,$\operatorname{span}(e_1,e_2)=\operatorname{span}(v_1,v_2)$。

第 1 步:单位化 v₁

$f_1=v_1$,$e_1=f_1/\|f_1\|$。第一个方向不需要「减影子」,只需把长度缩放成 1。

第 2 步:减去 v₂ 在 e₁ 上的影子

影子是 $\langle v_2,e_1\rangle e_1$(蓝色虚线箭头),垂线从 $v_2$ 的尖端落到 $e_1$ 所在直线上。$f_2=v_2-\langle v_2,e_1\rangle e_1$ 与 $e_1$ 垂直。

第 3 步:单位化得到 e₂

$e_2=f_2/\|f_2\|$。此时 $e_1,e_2$ 张成的平面(浅色)正是 $\operatorname{span}(v_1,v_2)$——Gram–Schmidt 没有改变张成的空间,只是在这个平面里换了一副「直角坐标」。

第 4 步:减去 v₃ 在平面上的影子

$v_3$ 在平面上的影子是 $\langle v_3,e_1\rangle e_1+\langle v_3,e_2\rangle e_2$(平面内的虚线折线),垂线从 $v_3$ 的尖端落到平面上(与平面垂直)。$f_3=v_3-(\text{影子})$ 与整个平面垂直。

第 5 步:单位化得到 e₃,完成

$e_3=f_3/\|f_3\|$。$e_1,e_2,e_3$ 两两垂直、长度为 1,是 $\mathbf{R}^3$ 的规范正交基;读数里的内积表验证了 $\langle e_j,e_k\rangle$ 在对角线上为 1、其余为 0。

每一步新产生的 $f_k$ 都垂直于之前的所有 $e_j$:第 2 步垂直于一条直线,第 4 步垂直于整个平面。「上三角」型预设的结果恰好是标准基——因为 $\operatorname{span}(v_1)$ 是 $x$ 轴、$\operatorname{span}(v_1,v_2)$ 是 $xy$ 平面(这正是 6.37 背后的机制)。「几乎相关」时 $f_3$ 非常短,但 $e_3$ 仍被放大到长度 1;如果 $v_3$ 恰好落在平面里,$f_3=0$,算法会在这里「卡住」——这恰好说明原向量组线性相关(习题 6B.13)。

例𝒫₂(𝐑) 的一组规范正交基an orthonormal basis of 𝒫₂(𝐑)6.34

取内积 $\langle p,q\rangle=\int_{-1}^1pq$,对 $1,x,x^2$ 做 Gram–Schmidt:

  • $f_1=1$,$\|f_1\|^2=\int_{-1}^1 1=2$;
  • $f_2=x-\frac{\langle x,1\rangle}{2}\cdot1=x$(因为 $\int_{-1}^1t\,dt=0$),$\|f_2\|^2=\int_{-1}^1t^2dt=\frac23$;
  • $f_3=x^2-\frac12\langle x^2,1\rangle-\frac32\langle x^2,x\rangle x=x^2-\frac13$,$\|f_3\|^2=\int_{-1}^1\left(t^2-\frac13\right)^2dt=\frac{8}{45}$。

除以各自的范数,得到 $\mathcal{P}_2(\mathbf{R})$ 的规范正交基(长度 3 = 维数,由 6.28):

$$\sqrt{\tfrac12},\qquad \sqrt{\tfrac32}\,x,\qquad \sqrt{\tfrac{45}{8}}\left(x^2-\tfrac13\right).$$
−1 1 1 −1 0 e₁ e₂ e₃
例 6.34 的三个规范正交多项式:$e_1=\sqrt{1/2}$(蓝)、$e_2=\sqrt{3/2}\,x$(绿)、$e_3=\sqrt{45/8}\,(x^2-1/3)$(紫)。它们在 $[-1,1]$ 上「两两正交」:任意两条曲线乘积下方的有向面积为 0。(除常数倍外,它们就是 Legendre 多项式。)
推论规范正交基存在existence of orthonormal basis6.35

每个有限维内积空间都有规范正交基。——任取一组基做 Gram–Schmidt,得到长度为 $\dim V$ 的规范正交组,由 6.28 它就是基。

推论规范正交组可扩充为规范正交基every orthonormal list extends to an orthonormal basis6.36

设 $V$ 有限维,则每个规范正交组 $e_1,\dots,e_m$ 都能扩充成 $V$ 的规范正交基。——先把它扩充成一组基 $e_1,\dots,e_m,v_1,\dots,v_n$(2.32),再做 Gram–Schmidt:前 $m$ 个向量本来就规范正交,公式不会改动它们。

第 5 章给出了算子在某组基下有上三角矩阵的充要条件(5.44)。有了内积,自然想问:能不能要求这组基是规范正交的?答案是:条件完全一样。

定理关于某组规范正交基的上三角矩阵upper-triangular matrix with respect to some orthonormal basis6.37

设 $V$ 有限维,$T\in\mathcal{L}(V)$。则 $T$ 关于 $V$ 的某组规范正交基有上三角矩阵,当且仅当 $T$ 的极小多项式形如 $(z-\lambda_1)\cdots(z-\lambda_m)$,其中 $\lambda_1,\dots,\lambda_m\in\mathbf{F}$。

证明思路

若 $T$ 关于基 $v_1,\dots,v_n$ 是上三角的,则每个 $\operatorname{span}(v_1,\dots,v_k)$ 都在 $T$ 下不变(5.39)。对 $v_1,\dots,v_n$ 做 Gram–Schmidt 得到 $e_1,\dots,e_n$,由于 $\operatorname{span}(e_1,\dots,e_k)=\operatorname{span}(v_1,\dots,v_k)$,这些子空间仍然不变,所以 $T$ 关于 $e_1,\dots,e_n$ 仍是上三角的(5.39)。再结合 5.44 即可。

定理Schur 定理Schur’s theorem6.38

有限维复内积空间上的每个算子,都关于某组规范正交基有上三角矩阵。

证明:由代数基本定理的第二种形式(4.13),复空间上的极小多项式总能分解成一次因式之积,再用 6.37。Schur 于 1909 年发表这个结果。第 7 章证明复谱定理时,正是从 Schur 定理出发的。

$e_1,\dots,e_n$ 是 $V$ 的规范正交基。$v$ 关于这组基的第 $k$ 个坐标是什么?

对 $\mathbf{R}^2$ 中的 $v_1=(3,4)$、$v_2=(1,0)$ 做 Gram–Schmidt,得到的 $e_2$ 是?

内积空间上的线性泛函 Linear Functionals on Inner Product Spaces

取值在标量域 $\mathbf{F}$ 中的线性映射很特殊,3F 节给了它们专门的名字。这一小节要说明:在有限维内积空间里,线性泛函一点也不神秘——每一个都是「与某个固定向量做内积」。

定义线性泛函、对偶空间linear functional, dual space, V′6.39

$V$ 上的线性泛函是从 $V$ 到 $\mathbf{F}$ 的线性映射;所有线性泛函组成的向量空间 $V'=\mathcal{L}(V,\mathbf{F})$ 叫 $V$ 的对偶空间。

例𝐅³ 上的线性泛函6.40

$\varphi(z_1,z_2,z_3)=2z_1-5z_2+z_3$ 可以写成 $\varphi(z)=\langle z,w\rangle$,其中 $w=(2,-5,1)$。

例𝒫₅(𝐑) 上的线性泛函6.41

$\varphi(p)=\int_{-1}^1p(t)\cos(\pi t)\,dt$ 是 $\mathcal{P}_5(\mathbf{R})$ 上的线性泛函。

由 6.6(a),对固定的 $v$,$u\mapsto\langle u,v\rangle$ 是线性泛函。反过来呢?在例 6.41 中给 $\mathcal{P}_5(\mathbf{R})$ 配上内积 $\langle p,q\rangle=\int_{-1}^1pq$,是否存在多项式 $q\in\mathcal{P}_5(\mathbf{R})$ 使得对所有 $p$ 都有 $\int_{-1}^1p(t)\cos(\pi t)\,dt=\langle p,q\rangle$?不能取 $q=\cos(\pi t)$,因为它不是多项式。下面的定理给出一个有点出人意料的回答:这样的 $q$ 一定存在。

定理Riesz 表示定理Riesz representation theorem6.42

设 $V$ 有限维,$\varphi$ 是 $V$ 上的线性泛函。则存在唯一的 $v\in V$,使得

$$\varphi(u)=\langle u,v\rangle\quad\text{对所有 } u\in V .$$
证明思路:用规范正交基把 φ「拼」出来

存在:取规范正交基 $e_1,\dots,e_n$。由 6.30(a) 和 $\varphi$ 的线性,

$$\varphi(u)=\varphi\Big(\sum_k\langle u,e_k\rangle e_k\Big)=\sum_k\langle u,e_k\rangle\varphi(e_k)=\Big\langle u,\ \sum_k\overline{\varphi(e_k)}\,e_k\Big\rangle ,$$

所以取

$$v=\overline{\varphi(e_1)}\,e_1+\cdots+\overline{\varphi(e_n)}\,e_n$$6.43

即可(共轭来自第二个位置的共轭线性)。唯一:若 $\langle u,v_1\rangle=\langle u,v_2\rangle$ 对所有 $u$ 成立,则 $\langle u,v_1-v_2\rangle=0$;取 $u=v_1-v_2$ 得 $v_1=v_2$。

直觉:线性泛函 = 一族平行的等值线 = 一个箭头 在 $\mathbf{R}^2$ 中,线性泛函 $\varphi$ 的图像是一族平行等距的等值线 $\{u:\varphi(u)=c\}$,其中 $c=0$ 的那条就是 $\operatorname{null}\varphi$。Riesz 定理把这整族线压缩成一个箭头 $v$:$v$ 垂直于等值线、指向 $\varphi$ 增大的方向,长度 $\|v\|$ 就是 $\varphi$ 增长的「陡度」(相邻两条整数等值线的间距恰为 $1/\|v\|$)。于是 $\varphi(u)=\langle u,v\rangle$ 读作:量一量 $u$ 在 $v$ 方向上的影子,再乘以 $\|v\|$。
Riesz 表示定理:从等值线找到那个向量

用滑块设定线性泛函在标准基上的取值 $\varphi(e_1)$、$\varphi(e_2)$,图上画出它的等值线 $\varphi=c$(紫色粗线是 $\operatorname{null}\varphi$)。红色 $v$ 是 Riesz 向量。拖动蓝色 $u$ 读出 $\varphi(u)=\langle u,v\rangle$。再旋转另一组规范正交基 $f_1,f_2$:不管怎么转,$\varphi(f_1)f_1+\varphi(f_2)f_2$(绿色折线)总是拼出同一个 $v$。

① 等值线越密,$v$ 越长——$\|v\|$ 是 $\varphi$ 的「陡度」。② $v$ 总垂直于 $\operatorname{null}\varphi$:$v$ 张成的直线正是 $(\operatorname{null}\varphi)^\perp$,这就是 6.58 给出第二个证明的思路。③ 把 $u$ 沿着一条等值线滑动,$\varphi(u)$ 不变——因为 $u$ 在 $v$ 方向上的影子没变。④ 公式 6.43 表面上依赖规范正交基的选取,但转动 $f_1,f_2$ 时绿色折线的终点纹丝不动:唯一性保证了结果与基无关。⑤ 两个滑块都拨到 0 时 $\varphi=0$,对应 $v=0$。

例Riesz 表示的一次具体计算computation illustrating Riesz representation theorem6.44

求 $q\in\mathcal{P}_2(\mathbf{R})$,使得对每个 $p\in\mathcal{P}_2(\mathbf{R})$ 都有

$$\int_{-1}^1p(t)\cos(\pi t)\,dt=\int_{-1}^1pq .$$6.45

把右边当作 $\mathcal{P}_2(\mathbf{R})$ 上的内积,左边就是线性泛函 $\varphi(p)$。取例 6.34 的规范正交基代入公式 6.43(实数情形共轭可省略),算几个积分即得

$q(x)=\dfrac{15}{2\pi^2}\left(1-3x^2\right)$。

同样的办法在 $\mathcal{P}_5(\mathbf{R})$ 中得到 $q(x)=\frac{105}{8\pi^4}\Big((27-2\pi^2)+(24\pi^2-270)x^2+(315-30\pi^2)x^4\Big)$。

−1 1 1 −1 cos(πt) q(在 𝒫₂ 中) q(在 𝒫₅ 中)
红:$\cos(\pi t)$;蓝:𝒫₂ 中的表示多项式 $q$;绿虚线:𝒫₅ 中的 $q$。$q$ 会越来越像 $\cos(\pi t)$ 并非巧合:$q$ 正是 $\cos(\pi t)$ 在多项式子空间上的正交投影(6C 的最佳逼近,参见习题 6C.8)。
两点补充 ① 公式 6.43 的右边看起来依赖于规范正交基的选择,但 6.42 说 $v$ 由 $\varphi$ 唯一确定,所以换哪组规范正交基算出来都一样(上面演示里转动 $f_1,f_2$ 就是在验证这一点)。另两种证明见 6.58 与习题 6C.13。
② 有限维是必要的:在 $C[-1,1]$(内积 $\int_{-1}^1fg$)上,$\varphi(f)=f(0)$ 是线性泛函,却找不到任何连续函数 $g$ 使 $\varphi(f)=\langle f,g\rangle$ 对所有 $f$ 成立(习题 6B.22)。

在 $\mathbf{R}^3$ 上,$\varphi(x,y,z)=x-2y+3z$。满足 $\varphi(u)=\langle u,v\rangle$(对所有 $u$)的 $v$ 是?

在 $\mathbf{C}^2$(欧氏内积)上,$\varphi(z_1,z_2)=i\,z_1$。Riesz 向量 $v$ 是?

规范正交组orthonormal list每个向量长度为 1、两两正交:$\langle e_j,e_k\rangle$ 当 $j=k$ 时为 1,否则为 0。
规范正交基orthonormal basis同时是基的规范正交组;在它下面坐标 $=\langle v,e_k\rangle$。
Bessel 不等式Bessel’s inequality$\sum_k|\langle v,e_k\rangle|^2\le\|v\|^2$:互相垂直方向上的影子平方和不超过本体长度平方。
Parseval 恒等式Parseval’s identity对规范正交基:$\|v\|^2=\sum_k|\langle v,e_k\rangle|^2$。
Gram–Schmidt 过程Gram–Schmidt procedure逐个减去在已有方向上的影子再单位化,把线性无关组变成规范正交组,张成空间逐级不变。
Schur 定理Schur’s theorem有限维复内积空间上的算子关于某组规范正交基有上三角矩阵。
线性泛函linear functional从 $V$ 到 $\mathbf{F}$ 的线性映射;全体构成对偶空间 $V'=\mathcal{L}(V,\mathbf{F})$。
Riesz 表示定理Riesz representation theorem有限维时,每个线性泛函 $\varphi$ 都唯一地写成 $\varphi(u)=\langle u,v\rangle$。
本节要点
  • 规范正交组自动线性无关;Bessel:影子平方和 ≤ 本体长度平方。
  • 规范正交基下:坐标 = 内积,$\|v\|^2$ = 坐标平方和(Parseval),内积 = 坐标的「点积」。
  • Gram–Schmidt = 反复做正交分解再单位化;由它得到规范正交基的存在、扩充,以及 Schur 定理。
  • Riesz:线性泛函 $\varphi$ ↔ 唯一向量 $v=\sum\overline{\varphi(e_k)}e_k$,$v$ 垂直于 $\varphi$ 的等值线。

6C 正交补与最小化问题 Orthogonal Complements and Minimization Problems

这一节解决一个极其实用的问题:给定子空间 $U$ 和一点 $v$,$U$ 中哪一点离 $v$ 最近?答案是正交投影 $P_Uv$。为此先研究「与 $U$ 垂直的全体向量」——正交补 $U^\perp$;再用投影解决最小化问题(函数逼近、最小二乘);最后用同样的思想定义伪逆,让「解不了的方程」也有最好的解。

正交补 Orthogonal Complements

定义正交补orthogonal complement, U⊥6.46

设 $U$ 是 $V$ 的子集。$U$ 的正交补是与 $U$ 中每个向量都正交的向量全体:

$$U^\perp=\{v\in V:\ \langle u,v\rangle=0\ \text{对每个}\ u\in U\}.$$

$U^\perp$ 也依赖于大空间 $V$,但 $V$ 通常由上下文确定,记号中省略。$U^\perp$ 读作「U perp」。

例正交补orthogonal complements6.47
  • $V=\mathbf{R}^3$,$U=\{(2,3,5)\}$(单独一个点):$U^\perp$ 是平面 $2x+3y+5z=0$。
  • $U$ 是平面 $2x+3y+5z=0$:$U^\perp$ 是直线 $\{(2t,3t,5t):t\in\mathbf{R}\}$。
  • 一般地,在 $\mathbf{R}^3$ 中:过原点的平面 ↔ 与它垂直的过原点直线,二者互为正交补。
  • $V=\mathbf{F}^5$,$U=\{(a,b,0,0,0)\}$:$U^\perp=\{(0,0,x,y,z)\}$。
  • 若 $e_1,\dots,e_m,f_1,\dots,f_n$ 是 $V$ 的规范正交基,则 $\big(\operatorname{span}(e_1,\dots,e_m)\big)^\perp=\operatorname{span}(f_1,\dots,f_n)$。
命题正交补的性质properties of orthogonal complement6.48
结论一句话理由 / 直觉
(a)对任意子集 $U$,$U^\perp$ 是子空间「与 $U$ 中每个向量都垂直」这个条件对加法、数乘封闭(哪怕 $U$ 只是几个点)
(b)$\{0\}^\perp=V$每个向量都与 0 垂直
(c)$V^\perp=\{0\}$与自己也垂直的只有 0
(d)$U\cap U^\perp\subseteq\{0\}$同上:若 $u\in U\cap U^\perp$ 则 $\langle u,u\rangle=0$
(e)$G\subseteq H\Rightarrow H^\perp\subseteq G^\perp$要垂直的向量越多,满足条件的向量越少
定理子空间与其正交补的直和direct sum of a subspace and its orthogonal complement6.49

设 $U$ 是 $V$ 的有限维子空间,则 $V=U\oplus U^\perp$。

证明思路:还是「影子 + 垂线」,只是影子落在整个子空间上

取 $U$ 的规范正交基 $e_1,\dots,e_m$,对任意 $v$ 写

$$v=\underbrace{\langle v,e_1\rangle e_1+\cdots+\langle v,e_m\rangle e_m}_{u\ \in\ U}+\underbrace{v-\langle v,e_1\rangle e_1-\cdots-\langle v,e_m\rangle e_m}_{w}.$$6.50

对每个 $k$,$\langle w,e_k\rangle=\langle v,e_k\rangle-\langle v,e_k\rangle=0$,所以 $w$ 与 $U$ 的每个向量正交,$w\in U^\perp$。于是 $V=U+U^\perp$;又 $U\cap U^\perp=\{0\}$(6.48(d)),所以是直和(1.46)。

推论正交补的维数dimension of orthogonal complement6.51

$V$ 有限维时,$\dim U^\perp=\dim V-\dim U$(由 6.49 与 3.94)。

推论正交补的正交补orthogonal complement of the orthogonal complement6.52

$U$ 有限维时,$U=(U^\perp)^\perp$。

6.52 的证明思路

$U\subseteq(U^\perp)^\perp$ 6.53 是显然的:$U$ 中的向量与 $U^\perp$ 的每个向量都垂直。反过来,设 $v\in(U^\perp)^\perp$,按 6.49 写 $v=u+w$($u\in U$,$w\in U^\perp$)。则 $v-u=w\in U^\perp$,同时 $v-u\in(U^\perp)^\perp$(两者都在里面),所以 $v-u\in U^\perp\cap(U^\perp)^\perp=\{0\}$,即 $v=u\in U$。

推论U⊥ = {0} ⟺ U = VU⊥ = {0} ⟺ U = V (for U a finite-dimensional subspace of V)6.54

设 $U$ 是 $V$ 的有限维子空间,则 $U^\perp=\{0\}\iff U=V$。——想证明某个子空间就是全空间时,一个好办法是证明「只有 0 与它垂直」。

常见误区:无限维时这些结论可能失效 6.49、6.52、6.54 都要求 $U$ 有限维。反例(习题 6C.16):在 $C[-1,1]$(内积 $\int_{-1}^1fg$)中,$U=\{f: f(0)=0\}$ 满足 $U^\perp=\{0\}$,但 $U\ne V$;于是 $U\oplus U^\perp=U\ne V$,且 $(U^\perp)^\perp=V\ne U$。
常见误区:正交补不是「补集」 $U^\perp$ 是一个子空间,不是集合论意义下的补集 $V\setminus U$。例如在 $\mathbf{R}^2$ 中,$U$ 是 $x$ 轴时 $U^\perp$ 是 $y$ 轴——两条轴合起来远远盖不住整个平面,但每个向量都能拆成「$x$ 轴上的部分 + $y$ 轴上的部分」。「直和」说的是这种拆分,而不是并集。

有了直和 $V=U\oplus U^\perp$,每个 $v$ 都能唯一地拆成「$U$ 里的部分」加「$U^\perp$ 里的部分」。只保留前者,就得到正交投影。

定义正交投影orthogonal projection, PU6.55

设 $U$ 是 $V$ 的有限维子空间。对每个 $v\in V$ 写 $v=u+w$($u\in U$,$w\in U^\perp$),令 $P_Uv=u$。算子 $P_U\in\mathcal{L}(V)$ 叫做 $V$ 到 $U$ 上的正交投影。

例 6.56(投影到一条直线):$U=\operatorname{span}(u)$,$u\ne0$ 时,$P_Uv=\dfrac{\langle v,u\rangle}{\|u\|^2}\,u$——正是 6.13 中的「影子」。

命题正交投影的性质properties of orthogonal projection PU6.57

设 $U$ 是 $V$ 的有限维子空间。

结论几何意义
(a)$P_U\in\mathcal{L}(V)$投影是线性的
(b)$P_Uu=u$($u\in U$)$U$ 里的点不动
(c)$P_Uw=0$($w\in U^\perp$)垂直于 $U$ 的向量被压成 0
(d)$\operatorname{range}P_U=U$影子都落在 $U$ 里,且能落满
(e)$\operatorname{null}P_U=U^\perp$影子为 0 ⟺ 垂直于 $U$
(f)$v-P_Uv\in U^\perp$「误差」垂直于 $U$(最小化问题的关键)
(g)$P_U^2=P_U$投影两次 = 投影一次
(h)$\|P_Uv\|\le\|v\|$影子不长于本体(勾股定理)
(i)$P_Uv=\langle v,e_1\rangle e_1+\cdots+\langle v,e_m\rangle e_m$计算公式:$e_1,\dots,e_m$ 是 $U$ 的规范正交基
证明思路

(a):若 $v_1=u_1+w_1$,$v_2=u_2+w_2$,则 $v_1+v_2=(u_1+u_2)+(w_1+w_2)$ 仍是「$U$ 部分 + $U^\perp$ 部分」,由分解的唯一性 $P_U(v_1+v_2)=u_1+u_2$;数乘同理。(b)(c):$u=u+0$,$w=0+w$。(d)(e) 由 (b)(c) 与定义得到。(f):$v-P_Uv=w$。(g):$P_U(P_Uv)=P_Uu=u$。(h):$\|v\|^2=\|u\|^2+\|w\|^2\ge\|u\|^2$。(i) 就是 6.50。

常见误区:投影公式只对规范正交基成立 6.57(i) 的 $P_Uv=\sum_k\langle v,e_k\rangle e_k$ 要求 $e_1,\dots,e_m$ 是 $U$ 的规范正交基。若随手拿一组普通的基 $u_1,\dots,u_m$ 代进去,$\sum_k\langle v,u_k\rangle u_k$ 一般不是投影(连长度都不对)。所以实际计算时,先用 Gram–Schmidt 把基「扶正」,再套公式——这正是 6B 为 6C 做的准备。
正交补与正交投影(ℝ³)

选择 $U$ 是直线还是平面,用滑块改变它的朝向。青色是 $U$,紫色是 $U^\perp$。拖动红色 $v$ 的尖端(在屏幕平面内移动);拖动琥珀色的点 $u$(它只能在 $U$ 里滑动);拖动空白处旋转视角。

① $v$ 被唯一地拆成绿色的 $P_Uv\in U$ 与紫色的 $v-P_Uv\in U^\perp$(6.49、6.57(f))。② 直线与平面互为正交补:$\dim U+\dim U^\perp=3$(6.51)。③ 拖动琥珀色的 $u$:虚线 $\|v-u\|$ 永远不短于 $\|v-P_Uv\|$,并且 $\|v-u\|^2=\|v-P_Uv\|^2+\|P_Uv-u\|^2$——这就是下一小节最近点定理 6.61 的证明。④ 把 $v$ 拖进 $U$ 里,$P_Uv=v$;拖到 $U^\perp$ 上,$P_Uv=0$(6.57(b)(c))。

定理Riesz 表示定理(再证明)Riesz representation theorem, revisited6.58

设 $V$ 有限维。对 $v\in V$,定义 $\varphi_v\in V'$ 为 $\varphi_v(u)=\langle u,v\rangle$。则 $v\mapsto\varphi_v$ 是从 $V$ 到 $V'$ 的一一对应(单射且满射)——这把 $V$ 与它的对偶空间 $V'$ 等同了起来。

证明思路:v 必须落在 (null φ)⊥ 这条直线上

只证满射。设 $\varphi\ne0$。若 $\varphi=\varphi_v$,则 $v\perp\operatorname{null}\varphi$;而由 6.51 与 3.21,$(\operatorname{null}\varphi)^\perp$ 是一维的。所以只要在这条直线上取非零 $w$,再乘上合适的倍数:

$$v=\frac{\overline{\varphi(w)}}{\|w\|^2}\,w .$$6.59

于是 $\|v\|=|\varphi(w)|/\|w\|$ 6.60,并且 $\varphi(v)=|\varphi(w)|^2/\|w\|^2=\|v\|^2$。对任意 $u$,写 $u=\Big(u-\frac{\varphi(u)}{\varphi(v)}v\Big)+\frac{\varphi(u)}{\|v\|^2}v$,括号里的部分在 $\operatorname{null}\varphi$ 中,因而与 $v$ 正交;两边与 $v$ 做内积即得 $\langle u,v\rangle=\varphi(u)$。

注意:$\mathbf{F}=\mathbf{R}$ 时 $v\mapsto\varphi_v$ 是线性的;$\mathbf{F}=\mathbf{C}$ 时它不是线性的,因为 $\varphi_{\lambda v}=\overline{\lambda}\varphi_v$。

在 $\mathbf{R}^3$ 中,$U=\operatorname{span}\big((1,1,0)\big)$,则 $U^\perp$ 是?

关于有限维子空间 $U$ 上的正交投影 $P_U$,下列哪一个说法是错误的?

最小化问题 Minimization Problems

下面这个问题经常出现:给定子空间 $U$ 和一点 $v\in V$,求 $u\in U$ 使 $\|v-u\|$ 尽可能小。答案简单得惊人——就是正交投影。原书页边注说:正是这个最小化问题的解如此简单,内积空间才在纯数学之外有了大量重要应用。

定理到子空间的最短距离minimizing distance to a subspace6.61

设 $U$ 是 $V$ 的有限维子空间,$v\in V$,$u\in U$。则

$$\|v-P_Uv\|\le\|v-u\|,$$

且等号成立当且仅当 $u=P_Uv$。也就是说:$P_Uv$ 是 $U$ 中离 $v$ 最近的唯一一点。

证明思路:一个直角三角形
$$\|v-P_Uv\|^2\ \le\ \|v-P_Uv\|^2+\|P_Uv-u\|^2\ =\ \|(v-P_Uv)+(P_Uv-u)\|^2\ =\ \|v-u\|^2 .$$6.62

中间的等号是勾股定理:$v-P_Uv\in U^\perp$(6.57(f)),而 $P_Uv-u\in U$,两者正交。等号成立 $\iff\|P_Uv-u\|=0\iff u=P_Uv$。

U 0 v PU v u ‖v − PUv‖ ‖v − u‖ ‖PUv − u‖
对应原书第 218 页插图:$P_Uv$ 是 $U$ 中离 $v$ 最近的点。对任意 $u\in U$,三点构成直角三角形,斜边 $\|v-u\|$ 总长于直角边 $\|v-P_Uv\|$。
实际怎么算:两步走 ① 用 Gram–Schmidt 求出 $U$ 的一组规范正交基 $e_1,\dots,e_m$;② 代入 6.57(i):$P_Uv=\langle v,e_1\rangle e_1+\cdots+\langle v,e_m\rangle e_m$。下面两个例子都是这样做的。

应用一:最小二乘拟合(补充例子)

原书没有专门讲数据拟合,但它正是 6.61 最著名的应用。给定数据点 $(x_1,y_1),\dots,(x_n,y_n)$,想找一条直线 $y=a+bx$,使残差平方和 $\sum_i\big(y_i-(a+bx_i)\big)^2$ 最小。把 $n$ 个数据看成 $\mathbf{R}^n$ 中的向量 $y=(y_1,\dots,y_n)$,并令 $\mathbf 1=(1,\dots,1)$、$x=(x_1,\dots,x_n)$,则

  • 所有可能的「拟合值」$a\mathbf 1+bx$ 组成子空间 $U=\operatorname{span}(\mathbf 1,x)\subseteq\mathbf{R}^n$;
  • 残差平方和就是 $\|y-(a\mathbf 1+bx)\|^2$——在 $U$ 中找离 $y$ 最近的点!

由 6.61,最佳拟合值 $\hat y=P_Uy$;残差 $r=y-\hat y\in U^\perp$,即 $\langle r,\mathbf 1\rangle=0$(残差之和为 0)且 $\langle r,x\rangle=0$——这两个方程就是统计学里的「正规方程」。用本节后面的语言说,系数 $(a,b)=T^\dagger y$,其中 $T(a,b)=a\mathbf 1+bx$(见 6.70)。

最小二乘:拖动数据点,看「投影」给出最佳拟合

拖动黑色数据点(点击空白处可以添加新点,最多 16 个)。蓝线是最小二乘拟合 $\hat y=P_Uy$;红色竖线是残差,勾选后画出以残差为边的正方形——它们的总面积就是要最小化的 $\|y-\hat y\|^2$。勾选「手动直线」用滑块自己调一条线(琥珀色),看看能不能打败最小二乘。

① 无论怎么调手动直线,它的残差平方和都不会小于蓝线的——这就是 6.61。② 读数里 $\langle r,\mathbf 1\rangle$、$\langle r,x\rangle$(抛物线时还有 $\langle r,x^2\rangle$)永远是 0:残差向量垂直于整个子空间 $U$,这正是 6.57(f)。③ 选「常数」模型时,最佳常数恰好是 $y_i$ 的平均值:平均值就是 $y$ 在 $\operatorname{span}(\mathbf 1)$ 上的投影 $\frac{\langle y,\mathbf 1\rangle}{\|\mathbf 1\|^2}\mathbf 1$。④ 把一个点拖得很远:平方会放大大残差,最小二乘直线会被明显「拽」过去。

应用二:用多项式逼近 sin x

例用线性代数逼近正弦函数using linear algebra to approximate the sine function6.63

求次数 $\le5$ 的实系数多项式 $u$,使它在 $[-\pi,\pi]$ 上尽可能接近 $\sin x$,即让 $\int_{-\pi}^{\pi}|\sin x-u(x)|^2\,dx$ 最小。

在 $C[-\pi,\pi]$ 上取内积 $\langle f,g\rangle=\int_{-\pi}^{\pi}fg$ 6.64,令 $v=\sin x$,$U$ = 次数 $\le5$ 的多项式(6 维)。问题变成:在 $U$ 中找离 $v$ 最近的点。做法正是上面的两步:对 $1,x,\dots,x^5$ 做 Gram–Schmidt 得到 $U$ 的规范正交基 $e_1,\dots,e_6$,再用 6.57(i) 算 $P_Uv$(「一台会积分的计算机很有用」),结果是

$$u(x)=0.987862\,x-0.155271\,x^3+0.00564312\,x^5 .$$6.65

与熟悉的 Taylor 多项式 $p(x)=x-\frac{x^3}{3!}+\frac{x^5}{5!}$ 6.66 相比:在 $x=3$ 处,$u$ 的误差约为 $0.001$,而 $p$ 的误差约为 $0.4$——大了几百倍。原书感叹:线性代数帮我们找到了比微积分所学更好的正弦逼近!

为什么差这么多? Taylor 多项式只关心 $x=0$ 附近:它让各阶导数在 0 处都对上,离 0 越远越不管。正交投影关心的是整个区间上的总平方误差,把误差均匀地摊开。两者回答的是不同的问题;如果你要在整段 $[-\pi,\pi]$ 上用,投影好得多。下面的演示可以换不同的次数对比。
sin x 的最佳多项式逼近 vs. Taylor 多项式

选择次数 $n$。红线是 $\sin x$,蓝线是它在「次数 $\le n$ 的多项式」上的正交投影(最佳逼近),绿色虚线是 $n$ 次 Taylor 多项式。下图用对数刻度画两者的误差。拖动图中的竖直探针(或用滑块)读出任意一点的误差;默认的 $n=5$、$x=3$ 正是原书的例子(原书第 219 页两幅插图的可动版本)。

① $n=5$ 时蓝线与红线几乎重合(原书说「眼睛可能只看到一条曲线」),而绿线在 $|x|\gt2$ 后明显偏离。② 对数误差图里,Taylor 的误差在 0 附近极小、在两端暴涨;投影的误差整体都很小、分布均匀。③ 次数每升 2,投影的平方误差 $\int|\sin x-u|^2$ 就缩小几十到上千倍。④ 只列出奇数次数:因为 $\sin x$ 是奇函数,它在偶次单项式上的投影为 0,$n=2k$ 与 $n=2k-1$ 的结果相同。

伪逆 Pseudoinverse

考虑方程 $Tv=w$,其中 $T\in\mathcal{L}(V,W)$。例如 $V=\mathbf{F}^n$、$W=\mathbf{F}^m$ 时,它就是 $m$ 个方程、$n$ 个未知数的线性方程组。$T$ 可逆时唯一解是 $v=T^{-1}w$;可 $T$ 不可逆时,对某些 $w$ 可能无解,对另一些 $w$ 又可能有无穷多解。怎么办?

  • 无解时,退而求其次:找 $v$ 使 $\|Tv-w\|$ 尽可能小(最佳近似解);
  • 解很多时,挑一个最「经济」的:在所有解中取 $\|v\|$ 最小的那一个。

伪逆 $T^\dagger$ 一次把这两件事都办了。下面总假设 $V$ 有限维(于是 $\operatorname{null}T$、$(\operatorname{null}T)^\perp$、$\operatorname{range}T$ 都有限维)。

引理限制成一一对应restriction of a linear map to obtain a one-to-one and onto map6.67

$T|_{(\operatorname{null}T)^\perp}$ 是从 $(\operatorname{null}T)^\perp$ 到 $\operatorname{range}T$ 上的单射(因而是双射)。

证明思路

单射:若 $v\in(\operatorname{null}T)^\perp$ 且 $Tv=0$,则 $v\in\operatorname{null}T\cap(\operatorname{null}T)^\perp=\{0\}$。满射:任取 $w=Tv\in\operatorname{range}T$,按 6.49 写 $v=u+x$($u\in\operatorname{null}T$,$x\in(\operatorname{null}T)^\perp$),则 $Tx=Tv-Tu=w$。

直觉:去掉「白费力气」的方向 $V=\operatorname{null}T\oplus(\operatorname{null}T)^\perp$。$T$ 把 $\operatorname{null}T$ 方向整个压成 0——往这些方向走完全是白费力气;真正起作用的只有 $(\operatorname{null}T)^\perp$ 这一部分,而它被 $T$ 一一对应地搬到 $\operatorname{range}T$ 上。所以在这两个子空间之间,$T$ 是可以求逆的。
定义伪逆pseudoinverse, T†6.68

$T$ 的伪逆 $T^\dagger\in\mathcal{L}(W,V)$(读作「T dagger」)定义为

$$T^\dagger w=\big(T|_{(\operatorname{null}T)^\perp}\big)^{-1}P_{\operatorname{range}T}\,w .$$

两步走:① 先把 $w$ 投影到 $\operatorname{range}T$ 上(离 $w$ 最近的「够得着」的点);② 再在 $(\operatorname{null}T)^\perp$ 里找它唯一的原像。特别地:$w\in(\operatorname{range}T)^\perp$ 时 $T^\dagger w=0$;$w\in\operatorname{range}T$ 时,$T^\dagger w$ 是 $(\operatorname{null}T)^\perp$ 中唯一满足 $T(T^\dagger w)=w$ 的向量。

命题伪逆的代数性质algebraic properties of the pseudoinverse6.69

(a) 若 $T$ 可逆,则 $T^\dagger=T^{-1}$;  (b) $TT^\dagger=P_{\operatorname{range}T}$;  (c) $T^\dagger T=P_{(\operatorname{null}T)^\perp}$。

于是:$T$ 满射时 $TT^\dagger=I$;$T$ 单射时 $T^\dagger T=I$。伪逆也叫 Moore–Penrose 逆(Moore–Penrose inverse)。更多性质($P^\dagger=P$、$TT^\dagger T=T$、$(T^\dagger)^\dagger=T$ 等)见习题 6C.19–23。

证明思路

(a) 可逆时 $(\operatorname{null}T)^\perp=V$、$\operatorname{range}T=W$,两步都是「原样」与「真逆」。(b) 在 $\operatorname{range}T$ 上 $TT^\dagger w=w$,在 $(\operatorname{range}T)^\perp$ 上 $TT^\dagger w=0$,与 $P_{\operatorname{range}T}$ 在两个互补的子空间上都一致,由 6.49 二者相等。(c) 同理:在 $(\operatorname{null}T)^\perp$ 上 $T^\dagger Tv=v$,在 $\operatorname{null}T$ 上 $T^\dagger Tv=0$。

定理伪逆给出最佳近似解 / 最佳解pseudoinverse provides best approximate solution or best solution6.70

设 $w\in W$。

(a) 对任意 $v\in V$:$\ \|T(T^\dagger w)-w\|\le\|Tv-w\|$,等号成立当且仅当 $v\in T^\dagger w+\operatorname{null}T$。

(b) 对任意 $v\in T^\dagger w+\operatorname{null}T$:$\ \|T^\dagger w\|\le\|v\|$,等号成立当且仅当 $v=T^\dagger w$。

合起来:取 $v=T^\dagger w$ 让 $Tv$ 尽可能接近 $w$(最佳拟合,best fit);在所有这样的 $v$ 中,$T^\dagger w$ 的范数最小。

证明思路:两次勾股定理

(a) 写 $Tv-w=(Tv-TT^\dagger w)+(TT^\dagger w-w)$。第一项在 $\operatorname{range}T$ 中;由 6.69(b),$TT^\dagger$ 是到 $\operatorname{range}T$ 的正交投影,所以第二项在 $(\operatorname{range}T)^\perp$ 中(6.57(f))。勾股定理给出不等式;等号 $\iff$ 第一项为 0 $\iff v-T^\dagger w\in\operatorname{null}T$。

(b) 写 $v=(v-T^\dagger w)+T^\dagger w$。第一项在 $\operatorname{null}T$ 中,而由定义 $T^\dagger w\in(\operatorname{null}T)^\perp$,再用勾股定理。

伪逆两步走:最佳近似解中最短的那一个

左图是定义域 $V=\mathbf{R}^2$,右图是到达空间 $W=\mathbf{R}^2$。拖动右图紫色的 $w$,拖动左图蓝色的候选解 $v$(右图的蓝点是 $Tv$)。用步骤播放器一步步看 $T^\dagger w$ 是怎样造出来的;也可以换成可逆映射、投影或零映射。

第 1 步:把 w 投影到 range T

右图:$Tv$ 只能落在直线 $\operatorname{range}T$(绿色)上。离 $w$ 最近的「够得着」的点是投影 $P_{\operatorname{range}T}w$(绿点),最小残差是紫色虚线的长度。

第 2 步:在 (null T)⊥ 里取原像

左图:$\operatorname{null}T$(红色虚线)被 $T$ 压成 0;与它垂直的直线 $(\operatorname{null}T)^\perp$(绿色)被 $T$ 一一对应地映到 $\operatorname{range}T$。其中唯一满足 $Tv=P_{\operatorname{range}T}w$ 的点就是 $T^\dagger w$(绿点)。

第 3 步:所有最佳近似解

给 $T^\dagger w$ 加上 $\operatorname{null}T$ 中的任何向量,$T$ 的值不变。所以最佳近似解构成直线 $T^\dagger w+\operatorname{null}T$(琥珀色)。把蓝点 $v$ 拖到这条线上,右图的 $Tv$ 就与绿点重合,残差达到最小(6.70(a))。

第 4 步:T†w 是其中最短的

琥珀色直线上离原点最近的点,正是它与 $(\operatorname{null}T)^\perp$ 的交点 $T^\dagger w$:以原点为心、过 $T^\dagger w$ 的圆与这条直线相切(6.70(b))。

① 不管 $v$ 在哪,右图 $\|Tv-w\|$ 都不小于最小残差;只有 $v$ 落在琥珀色直线上才取等号。② 沿琥珀色直线滑动 $v$,$Tv$ 不动,但 $\|v\|$ 在 $T^\dagger w$ 处最小。③ 选「可逆」:$\operatorname{null}T=\{0\}$,琥珀色直线缩成一个点,$T^\dagger w=T^{-1}w$,残差为 0(6.69(a))。④ 选「正交投影」:$T^\dagger=T$(习题 6C.19)。⑤ 选「零映射」:$\operatorname{range}T=\{0\}$,$T^\dagger w=0$,任何 $v$ 都是「最佳」近似解,其中最短的就是 0。

例从 𝐅⁴ 到 𝐅³ 的映射的伪逆pseudoinverse of a linear map from 𝐅⁴ to 𝐅³6.71

设 $T(a,b,c,d)=(a+b+c,\ 2c+d,\ 0)$。它既不单也不满,但伪逆照样能算:

  • $\operatorname{range}T=\{(x,y,0)\}$,所以 $P_{\operatorname{range}T}(x,y,z)=(x,y,0)$;
  • $\operatorname{null}T=\{a+b+c=0,\ 2c+d=0\}$,一组基是 $(-1,1,0,0)$、$(-1,0,1,-2)$;
  • $T^\dagger(x,y,z)$ 6.72 是满足 $T(a,b,c,d)=(x,y,0)$ 且 与 $\operatorname{null}T$ 的两个基向量正交的 $(a,b,c,d)$:
$$a+b+c=x,\quad 2c+d=y,\quad -a+b=0,\quad -a+c-2d=0 .$$

解这个 4 元方程组得

$$T^\dagger(x,y,z)=\tfrac{1}{11}\big(5x-2y,\ 5x-2y,\ x+4y,\ -2x+3y\big).$$

验算:$TT^\dagger(x,y,z)=(x,y,0)=P_{\operatorname{range}T}(x,y,z)$,与 6.69(b) 吻合。注意 $z$ 完全不起作用——它是 $w$ 中「够不着」的那部分,被第一步的投影丢掉了。$T^\dagger$ 的一般公式(借助奇异值分解)见第 7 章的 7.78。

设 $T\in\mathcal{L}(V,W)$ 是单射(但不一定满射)。下列哪个等式一定成立?

方程 $Tv=w$ 有无穷多个解。伪逆给出的 $T^\dagger w$ 是其中的哪一个?

正交补orthogonal complement$U^\perp=\{v:\langle u,v\rangle=0\ \forall u\in U\}$;有限维 $U$ 满足 $V=U\oplus U^\perp$。
正交投影orthogonal projection$P_Uv$ = $v$ 在 $U\oplus U^\perp$ 分解中的 $U$ 部分;$P_Uv=\sum\langle v,e_k\rangle e_k$。
最近点定理minimizing distance to a subspace$\|v-P_Uv\|\le\|v-u\|$ 对所有 $u\in U$ 成立,只在 $u=P_Uv$ 时取等号。
伪逆pseudoinverse$T^\dagger w=(T|_{(\operatorname{null}T)^\perp})^{-1}P_{\operatorname{range}T}w$:最佳近似解中范数最小的一个。
最小二乘least squares使残差平方和 $\|y-\hat y\|^2$ 最小:$\hat y$ 是 $y$ 在设计矩阵列空间上的正交投影。
本节要点
  • $U^\perp$ 总是子空间;$U$ 有限维时 $V=U\oplus U^\perp$,$\dim U^\perp=\dim V-\dim U$,$(U^\perp)^\perp=U$。
  • $P_U$:线性、幂等($P_U^2=P_U$)、值域 $U$、零空间 $U^\perp$、误差 $v-P_Uv\perp U$;用规范正交基 $P_Uv=\sum\langle v,e_k\rangle e_k$。
  • 最近点 = 正交投影(6.61):函数的最佳多项式逼近、数据的最小二乘拟合都是它。
  • 伪逆 = 先投影到 $\operatorname{range}T$,再在 $(\operatorname{null}T)^\perp$ 里取原像;$TT^\dagger=P_{\operatorname{range}T}$,$T^\dagger T=P_{(\operatorname{null}T)^\perp}$。

本章小结

一条主线:内积 → 长度与垂直 → 正交分解(影子 + 垂线)+ 勾股定理 → 规范正交基与 Gram–Schmidt → 正交补与正交投影 → 最近点 → 最佳逼近、最小二乘、伪逆。几乎每个结果的证明都是「拆成互相垂直的两部分,再用勾股定理」。

概念 / 结果一句话几何图像原书编号
内积、范数正性、定性、第一位线性、共轭对称;$\|v\|=\sqrt{\langle v,v\rangle}$给空间装上「尺子」和「量角器」6.2 · 6.7
正交分解$u=\frac{\langle u,v\rangle}{\|v\|^2}v+w$,$w\perp v$影子 + 垂线6.13
Cauchy–Schwarz$|\langle u,v\rangle|\le\|u\|\,\|v\|$,共线取等影子不长于本体6.14
三角不等式 / 平行四边形$\|u+v\|\le\|u\|+\|v\|$;对角线平方和 = 四边平方和三角形、平行四边形6.17 · 6.21
Bessel / Parseval$\sum|\langle v,e_k\rangle|^2\le\|v\|^2$;基时取等多个垂直方向上的影子6.26 · 6.30
规范正交基坐标 = 内积 $\langle v,e_k\rangle$直角坐标系6.27 · 6.30
Gram–Schmidt逐个减去影子再单位化,张成逐级不变一维一维地「扶正」6.32
Schur 定理复空间上的算子关于某组规范正交基上三角G–S 保持不变子空间链6.37 · 6.38
Riesz 表示$\varphi(u)=\langle u,v\rangle$,$v=\sum\overline{\varphi(e_k)}e_k$ 唯一等值线的法向量6.42 · 6.58
正交补$V=U\oplus U^\perp$,$\dim U^\perp=\dim V-\dim U$,$(U^\perp)^\perp=U$平面 ↔ 法线6.46 – 6.54
正交投影 $P_U$$P_Uv=\sum\langle v,e_k\rangle e_k$;$P_U^2=P_U$,误差 $\perp U$影子落在子空间上6.55 · 6.57
最近点$\|v-P_Uv\|\le\|v-u\|$,唯一直角三角形斜边最长6.61
伪逆 $T^\dagger$$(T|_{(\operatorname{null}T)^\perp})^{-1}P_{\operatorname{range}T}$;最佳近似解中最短先投影,再回拉6.67 – 6.70
  • 什么时候需要有限维?6.35(规范正交基存在)、6.42(Riesz)、6.49/6.52/6.54(正交补的直和性质)都要求(子)空间有限维;无限维时可能失效(习题 6B.22、6C.16)。
  • 复数情形的细节:第二个位置共轭线性,所以 Riesz 公式里是 $\overline{\varphi(e_k)}$,而 $v\mapsto\varphi_v$ 在 $\mathbf{F}=\mathbf{C}$ 时不是线性的。
  • 与下一章的联系:第 7 章用 Riesz 表示定理定义伴随算子 $T^*$;复谱定理从 Schur 定理出发;QR 分解就是矩阵形式的 Gram–Schmidt;伪逆的公式由奇异值分解给出(7.78)。

自测

各节中已穿插了 11 道小测验,下面再补充几道综合题。

为什么说 $\mathbf{R}^2$ 上的 max 范数 $\max\{|x|,|y|\}$ 不来自任何内积?

$e_1,\dots,e_m$ 规范正交。Bessel 不等式 $\sum_k|\langle v,e_k\rangle|^2\le\|v\|^2$ 何时取等号?

对线性无关的 $v_1,v_2,v_3$ 做 Gram–Schmidt 得到 $e_1,e_2,e_3$。下列哪个说法一定正确?

在 $\mathbf{R}^4$ 中,$U$ 是一维子空间。正交投影 $P_U$ 的值域维数和零空间维数分别是?

习题

选自原书各节末的习题(编号与原书一致),每题附提示与完整解答。

6A.8设实数 $a,b,c,x,y$ 满足 $a^2+b^2+c^2+x^2+y^2\le1$。证明 $a+b+c+4x+9y\le10$。
提示把左边看成两个 $\mathbf{R}^5$ 向量的点积,用 Cauchy–Schwarz。注意 $1+1+1+16+81=100$。
参考解答

$a+b+c+4x+9y=\langle(a,b,c,x,y),(1,1,1,4,9)\rangle\le\|(a,b,c,x,y)\|\cdot\|(1,1,1,4,9)\|\le1\cdot\sqrt{100}=10$。等号在 $(a,b,c,x,y)=\frac{1}{10}(1,1,1,4,9)$ 时取到,所以 10 是最佳上界。

6A.11求 $u,v\in\mathbf{R}^2$,使 $u$ 是 $(1,3)$ 的标量倍,$v$ 与 $(1,3)$ 正交,且 $(1,2)=u+v$。
提示这正是 6.13 的正交分解:$u$ 是 $(1,2)$ 在 $(1,3)$ 方向上的影子。
参考解答

$c=\dfrac{\langle(1,2),(1,3)\rangle}{\|(1,3)\|^2}=\dfrac{7}{10}$,所以 $u=\frac{7}{10}(1,3)=\left(\frac{7}{10},\frac{21}{10}\right)$,$v=(1,2)-u=\left(\frac{3}{10},-\frac{1}{10}\right)$。验证:$\langle v,(1,3)\rangle=\frac{3}{10}-\frac{3}{10}=0$。由正交分解的唯一性($v$ 必须垂直于 $(1,3)$,这就确定了 $c$),这是唯一的答案。

6A.12设 $a,b,c,d$ 是正数。(a) 证明 $(a+b+c+d)\left(\frac1a+\frac1b+\frac1c+\frac1d\right)\ge16$;(b) 何时取等号?
提示取 $x=(\sqrt a,\sqrt b,\sqrt c,\sqrt d)$、$y=\left(\frac{1}{\sqrt a},\frac{1}{\sqrt b},\frac{1}{\sqrt c},\frac{1}{\sqrt d}\right)$。
参考解答

(a) $\langle x,y\rangle=1+1+1+1=4$。由 Cauchy–Schwarz,$16=\langle x,y\rangle^2\le\|x\|^2\|y\|^2=(a+b+c+d)\left(\frac1a+\frac1b+\frac1c+\frac1d\right)$。

(b) 取等 $\iff x,y$ 共线。两者都非零,所以存在 $\lambda$ 使 $x=\lambda y$,即 $\sqrt a=\lambda/\sqrt a$,得 $a=\lambda$;同理 $b=c=d=\lambda$。所以当且仅当 $a=b=c=d$ 时取等号。

6A.21设 $u,v\in V$,$\|u\|=3$,$\|u+v\|=4$,$\|u-v\|=6$。求 $\|v\|$。
提示平行四边形恒等式把这四个量联系在一起。
参考解答

由 6.21:$\|u+v\|^2+\|u-v\|^2=2(\|u\|^2+\|v\|^2)$,即 $16+36=2(9+\|v\|^2)$,所以 $\|v\|^2=17$,$\|v\|=\sqrt{17}$。

6B.2(a) 设 $\theta\in\mathbf{R}$。证明 $(\cos\theta,\sin\theta),(-\sin\theta,\cos\theta)$ 与 $(\cos\theta,\sin\theta),(\sin\theta,-\cos\theta)$ 都是 $\mathbf{R}^2$ 的规范正交基。(b) 证明 $\mathbf{R}^2$ 的每组规范正交基都是 (a) 中两种形式之一。
提示(b) 单位向量都能写成 $(\cos\theta,\sin\theta)$;再看与它垂直的单位向量有几个。
参考解答

(a) 每个向量的范数都是 $\sqrt{\cos^2\theta+\sin^2\theta}=1$;内积分别为 $-\cos\theta\sin\theta+\sin\theta\cos\theta=0$ 和 $\cos\theta\sin\theta-\sin\theta\cos\theta=0$。长度为 $2=\dim\mathbf{R}^2$ 的规范正交组,由 6.28 是规范正交基。

(b) 设 $e_1,e_2$ 是规范正交基。$\|e_1\|=1$,所以 $e_1=(\cos\theta,\sin\theta)$ 对某个 $\theta$ 成立。$e_2=(x,y)$ 要满足 $x\cos\theta+y\sin\theta=0$,这些 $(x,y)$ 恰好组成直线 $\operatorname{span}\big((-\sin\theta,\cos\theta)\big)$;再要求长度为 1,只有 $e_2=\pm(-\sin\theta,\cos\theta)$ 两种可能。取 $+$ 得第一种(旋转),取 $-$ 得 $(\sin\theta,-\cos\theta)$,即第二种(反射)。

6B.11求 $q\in\mathcal{P}_2(\mathbf{R})$,使得对每个 $p\in\mathcal{P}_2(\mathbf{R})$ 都有 $p\left(\frac12\right)=\int_0^1pq$。
提示$p\mapsto p(\frac12)$ 是线性泛函,Riesz 定理保证 $q$ 存在且唯一。可以用公式 6.43:先对 $1,x,x^2$ 在 $\langle p,q\rangle=\int_0^1pq$ 下做 Gram–Schmidt。
参考解答

对 $1,x,x^2$ 做 Gram–Schmidt(内积 $\int_0^1pq$)得规范正交基 $e_1=1$,$e_2=\sqrt3\,(2x-1)$,$e_3=\sqrt5\,(6x^2-6x+1)$。由 6.43(实数情形),$q=\sum_k e_k\!\left(\tfrac12\right)e_k$。而 $e_1(\frac12)=1$,$e_2(\frac12)=0$,$e_3(\frac12)=\sqrt5\left(\frac32-3+1\right)=-\frac{\sqrt5}{2}$,所以

$q(x)=1-\frac{\sqrt5}{2}\cdot\sqrt5\,(6x^2-6x+1)=-\frac32+15x-15x^2$。

验算(只需对 $p=1,x,x^2$ 检查):$\int_0^1q=-\frac32+\frac{15}{2}-5=1$,$\int_0^1xq=-\frac34+5-\frac{15}{4}=\frac12$,$\int_0^1x^2q=-\frac12+\frac{15}{4}-3=\frac14$,分别等于 $1,\frac12,\frac14$。

6B.13证明:向量组 $v_1,\dots,v_m$ 线性相关,当且仅当 Gram–Schmidt 公式(6.32)在某一步产生 $f_k=0$。
提示设 $k$ 是第一个满足 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$ 的下标。此前的步骤都正常进行,而 $f_k$ 是 $v_k$ 减去它在 $\operatorname{span}(e_1,\dots,e_{k-1})$ 上的投影。
参考解答

(⇒) 若线性相关,由线性相关性引理(2.19)存在最小的 $k$ 使 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$。于是 $v_1,\dots,v_{k-1}$ 线性无关,Gram–Schmidt 的前 $k-1$ 步正常进行,且 $U:=\operatorname{span}(e_1,\dots,e_{k-1})=\operatorname{span}(v_1,\dots,v_{k-1})$。此时 $f_k=v_k-\sum_{j\lt k}\langle v_k,e_j\rangle e_j=v_k-P_Uv_k$(6.57(i));因为 $v_k\in U$,$P_Uv_k=v_k$,所以 $f_k=0$。

(⇐) 设第一次出现 $f_k=0$。则 $f_1,\dots,f_{k-1}$ 都非零,且由 6.32,$\operatorname{span}(f_1,\dots,f_{k-1})=\operatorname{span}(v_1,\dots,v_{k-1})$。$f_k=0$ 意味着 $v_k$ 等于 $f_1,\dots,f_{k-1}$ 的线性组合,从而 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$,原组线性相关。

6C.5设 $V$ 有限维,$U$ 是 $V$ 的子空间。证明 $P_{U^\perp}=I-P_U$。
提示写 $v=u+w$,$u\in U$、$w\in U^\perp$,再用 $(U^\perp)^\perp=U$ 看同一个分解。
参考解答

任取 $v$,按 6.49 写 $v=u+w$,$u\in U$,$w\in U^\perp$,于是 $P_Uv=u$。由 6.52,$U=(U^\perp)^\perp$,所以 $v=w+u$ 恰是 $v$ 关于直和 $V=U^\perp\oplus(U^\perp)^\perp$ 的分解($w\in U^\perp$,$u\in(U^\perp)^\perp$)。按定义 $P_{U^\perp}v=w=v-u=v-P_Uv$。对所有 $v$ 成立,故 $P_{U^\perp}=I-P_U$。

6C.15在 $\mathbf{R}^4$ 中令 $U=\operatorname{span}\big((1,1,0,0),(1,1,1,2)\big)$。求 $u\in U$ 使 $\|u-(1,2,3,4)\|$ 最小。
提示最近点是 $P_U(1,2,3,4)$。先对两个张成向量做 Gram–Schmidt,再用 6.57(i)。
参考解答

$e_1=\frac{1}{\sqrt2}(1,1,0,0)$。$\langle(1,1,1,2),e_1\rangle=\sqrt2$,所以 $f_2=(1,1,1,2)-(1,1,0,0)=(0,0,1,2)$,$e_2=\frac{1}{\sqrt5}(0,0,1,2)$。记 $v=(1,2,3,4)$:$\langle v,e_1\rangle=\frac{3}{\sqrt2}$,$\langle v,e_2\rangle=\frac{11}{\sqrt5}$。于是

$u=P_Uv=\frac32(1,1,0,0)+\frac{11}{5}(0,0,1,2)=\left(\frac32,\ \frac32,\ \frac{11}{5},\ \frac{22}{5}\right)$。

验算:残差 $v-u=\left(-\frac12,\frac12,\frac45,-\frac25\right)$ 与 $(1,1,0,0)$、$(1,1,1,2)$ 的内积都是 0,确实垂直于 $U$。

6C.17求 $p\in\mathcal{P}_3(\mathbf{R})$,使 $p(0)=0$、$p'(0)=0$,并且 $\int_0^1|2+3x-p(x)|^2\,dx$ 尽可能小。
提示条件 $p(0)=p'(0)=0$ 说明 $p=\alpha x^2+\beta x^3$,即 $p\in U=\operatorname{span}(x^2,x^3)$。最优的 $p$ 使误差 $f-p$($f=2+3x$)垂直于 $x^2$ 与 $x^3$。
参考解答

取内积 $\langle f,g\rangle=\int_0^1fg$,所求 $p=P_Uf$。由 6.57(f),$f-p\perp x^2$ 且 $f-p\perp x^3$。用 $\int_0^1x^m\,dx=\frac{1}{m+1}$:

$$\frac{\alpha}{5}+\frac{\beta}{6}=\langle f,x^2\rangle=\frac23+\frac34=\frac{17}{12},\qquad \frac{\alpha}{6}+\frac{\beta}{7}=\langle f,x^3\rangle=\frac12+\frac35=\frac{11}{10}.$$

解得 $\alpha=24$,$\beta=-\frac{203}{10}$,所以 $p(x)=24x^2-\frac{203}{10}x^3$。

6C.21设 $T\in\mathcal{L}(\mathbf{F}^3,\mathbf{F}^2)$,$T(a,b,c)=(a+b+c,\ 2b+3c)$。(a) 求 $T^\dagger(x,y)$ 的公式;(b) 验证 $TT^\dagger=P_{\operatorname{range}T}$;(c) 验证 $T^\dagger T=P_{(\operatorname{null}T)^\perp}$。
提示先求 $\operatorname{null}T$(一维)。$T^\dagger(x,y)$ 是满足 $T(a,b,c)=(x,y)$ 且垂直于 $\operatorname{null}T$ 的唯一向量($T$ 是满射,第一步投影什么也不做)。
参考解答

(a) $\operatorname{null}T$:$a+b+c=0$、$2b+3c=0$,得 $\operatorname{null}T=\operatorname{span}(n)$,$n=(1,-3,2)$。$T$ 的秩为 2,是满射,所以 $P_{\operatorname{range}T}=I$,$T^\dagger(x,y)$ 就是满足

$$a+b+c=x,\qquad 2b+3c=y,\qquad a-3b+2c=0$$

的 $(a,b,c)$。由第三式 $a=3b-2c$,代入第一式得 $c=4b-x$,再代入第二式得 $b=\frac{3x+y}{14}$。于是

$T^\dagger(x,y)=\frac{1}{14}\big(13x-5y,\ 3x+y,\ -2x+4y\big)$。

(b) $TT^\dagger(x,y)=\frac{1}{14}\big((13x-5y)+(3x+y)+(-2x+4y),\ 2(3x+y)+3(-2x+4y)\big)=(x,y)$,即 $TT^\dagger=I=P_{\operatorname{range}T}$($\operatorname{range}T=\mathbf{F}^2$)。

(c) $T^\dagger T(a,b,c)=\frac{1}{14}\big(13a+3b-2c,\ 3a+5b+6c,\ -2a+6b+10c\big)$。另一方面,由习题 6C.5,$P_{(\operatorname{null}T)^\perp}=I-P_{\operatorname{null}T}$,而 $P_{\operatorname{null}T}(a,b,c)=\frac{a-3b+2c}{14}(1,-3,2)$,相减正好得到同一个结果。

第 7 章

内积空间上的算子 Operators on Inner Product Spaces

有了内积,就能给算子找一个「伴随」搭档。借着这个搭档,我们能精确回答:哪些算子可以用一组互相垂直的轴完全看透(谱定理),以及——任何线性映射其实都只是「转一下、沿垂直方向拉一拉、再转一下」(奇异值分解)。

学习目标
  • 理解伴随 $T^*$ 的定义与几何含义,会在规范正交基下用共轭转置计算它,掌握 $\operatorname{null}$、$\operatorname{range}$ 之间的正交关系(7.6)。
  • 分清自伴、正规、正、酉这几类算子:用「算子 ↔ 复数」的类比记住它们,并知道它们的特征值分别落在复平面的哪里。
  • 掌握实谱定理与复谱定理:什么样的算子能被一组规范正交基对角化;看懂「单位圆 → 主轴互相垂直的椭圆」这幅图。
  • 理解正算子的唯一正平方根,以及 QR 分解与 Cholesky 分解之间的关系。
  • 掌握奇异值与奇异值分解(SVD):任何线性映射 = 转 · 沿互相垂直的方向拉伸 · 再转;会用它写出 $T^*$、伪逆和矩阵形式 $A=BDC^*$。
  • 用 SVD 理解算子范数、最佳低秩逼近、极分解,以及体积为什么按奇异值之积缩放。
一分钟速览
  • 伴随:$T^*$ 由 $\langle Tv,w\rangle=\langle v,T^*w\rangle$ 唯一确定——它让 $T$ 能「跨过」内积换到另一边。在规范正交基下,$T^*$ 的矩阵就是 $T$ 的矩阵的共轭转置(实数情形就是转置)。
  • 全章主线是一个类比:算子 ↔ 复数,$T^*$ ↔ 共轭 $\bar z$。自伴($T=T^*$)↔ 实数,正算子 ↔ 非负数,酉算子 ↔ 单位圆,极分解 $T=S\sqrt{T^*T}$ ↔ $z=\frac{z}{|z|}\cdot|z|$。
  • 谱定理:$V$ 有一组由 $T$ 的特征向量构成的规范正交基 ⟺ $T$ 自伴($\mathbf F=\mathbf R$)/ $T$ 正规($\mathbf F=\mathbf C$)。图像:对称矩阵把单位圆变成椭圆,椭圆的主轴恰好是互相垂直的特征向量。
  • 正算子 = 自伴且特征值 ≥ 0 = 形如 $R^*R$;它有唯一的正平方根 $\sqrt T$:特征向量不变、特征值开方。
  • 等距 = 保长度 = 保内积 = $S^*S=I$ = 矩阵各列规范正交。QR 分解是 Gram–Schmidt 的矩阵记录;Cholesky 分解 $B=R^*R$ 直接由 QR 得到。
  • 奇异值 = $T^*T$ 特征值的非负平方根。SVD:$Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$——单位球被变成半轴为 $s_k$ 的椭球。
  • SVD 的推论:$\|T\|=s_1$(最大拉伸倍数);截断 SVD 是最佳低秩逼近,误差恰为 $s_{k+1}$;极分解 $T=S\sqrt{T^*T}$;体积按 $s_1\cdots s_n$ 倍缩放。
本章地图 7A 伴随 T*⟨Tv, w⟩ = ⟨v, T*w⟩ 7A 自伴 · 正规T = T* · TT* = T*T 7B 谱定理规范正交的特征基 7D 等距 · 酉算子保长度 · S*S = I 7C 正算子 · √T⟨Tv, v⟩ ≥ 0 · T = R*R 7E 奇异值 · SVD转 · 拉伸 · 再转 7D QR · CholeskyA = QR · B = R*R 7F 范数 · 低秩逼近‖T‖ = s₁ · 误差 = sₖ₊₁ 7F 极分解 · 体积T = S√(T*T) · 体积 × ∏sₖ

箭头表示「用到 / 推出」。点击方块跳到对应小节。第一行是「定义与分类」,第二行把谱定理用到三类重要算子上,第三行是矩阵分解与 SVD 的应用。

本章约定 (standing assumptions for this chapter)
  • $\mathbf F$ 表示 $\mathbf R$ 或 $\mathbf C$;
  • $V$、$W$ 是 $\mathbf F$ 上的非零有限维内积空间。
Axler 在章首说:本书其余部分最重要的结果都只在有限维成立,所以从此一直假定有限维。本章大量用到第 6 章的工具:规范正交基与 Gram–Schmidt(6.32)、Riesz 表示定理(6.42)、正交补(6.46–6.52)、Schur 定理(6.38)和伪逆(6.68)。

7A 自伴算子与正规算子 Self-Adjoint and Normal Operators

这一节要解决的问题:在内积空间里,一个线性映射 $T$ 有没有一个天然的「搭档」?答案是伴随 $T^*$。有了它,我们就能挑出两类最重要的算子——自伴算子($T=T^*$,行为像实数)和正规算子($T$ 与 $T^*$ 可交换)。下一节的谱定理会告诉你:恰恰是这两类算子,能被一组互相垂直的轴完全「看透」。

伴随 Adjoints

直觉 $\langle Tv,w\rangle$ 的读法是:先用 $T$ 把 $v$ 送进 $W$,再在 $W$ 里拿 $w$ 去「量」它。伴随问的是:能不能换个做法——$v$ 不动,而是把 $w$ 送回 $V$,在 $V$ 里量出同一个数?能做到这件事的映射就是 $T^*$。一句话:伴随让 $T$ 能从内积的左边「跨」到右边。
定义伴随adjoint, $T^*$7.1

设 $T\in\mathcal L(V,W)$。$T$ 的伴随(adjoint)是函数 $T^*:W\to V$,满足

$$\langle Tv,w\rangle=\langle v,T^*w\rangle\qquad\text{对所有 } v\in V,\ w\in W .$$

左边的内积在 $W$ 里算,右边的在 $V$ 里算,只是记号相同。

为什么这样的 $T^*$ 存在而且唯一?固定 $w\in W$,函数 $v\mapsto\langle Tv,w\rangle$ 是 $V$ 上的一个线性泛函。由 Riesz 表示定理 6.42,$V$ 中恰有一个向量 $u$ 使这个泛函等于 $v\mapsto\langle v,u\rangle$。我们就把这个 $u$ 记作 $T^*w$。所以:$T^*w$ 就是「用 $w$ 去量 $Tv$」这个泛函在 $V$ 中的代表向量——下面的第一个演示会把这句话画出来。

常见误区 线性代数里 adjoint 还有另一个含义(伴随矩阵/古典伴随,adjugate,与余子式有关)。两者毫无关系,本书的 adjoint 永远指这里的 $T^*$。
例从 $\mathbf R^3$ 到 $\mathbf R^2$ 的线性映射的伴随7.2

设 $T(x_1,x_2,x_3)=(x_2+3x_3,\ 2x_1)$。对 $(y_1,y_2)\in\mathbf R^2$:

$\langle T(x_1,x_2,x_3),(y_1,y_2)\rangle=x_2y_1+3x_3y_1+2x_1y_2=\langle (x_1,x_2,x_3),\,(2y_2,\ y_1,\ 3y_1)\rangle.$

所以 $T^*(y_1,y_2)=(2y_2,\ y_1,\ 3y_1)$。对照矩阵:$\mathcal M(T)=\begin{pmatrix} 0 & 1 & 3 \\ 2 & 0 & 0\end{pmatrix}$,$\mathcal M(T^*)=\begin{pmatrix} 0 & 2 \\ 1 & 0 \\ 3 & 0\end{pmatrix}$——正好是转置(原因见 7.9)。

例值域维数不超过 1 的线性映射的伴随7.3

固定 $u\in V$、$x\in W$,令 $Tv=\langle v,u\rangle x$(先沿 $u$ 方向量一下,再沿 $x$ 方向输出)。则

$\langle Tv,w\rangle=\langle v,u\rangle\langle x,w\rangle=\big\langle v,\ \langle w,x\rangle u\big\rangle$,所以 $T^*w=\langle w,x\rangle u$。

伴随把两个角色对调:沿 $x$ 方向量,沿 $u$ 方向输出。

计算 $T^*$ 的通用技巧 从 $\langle Tv,w\rangle$ 的具体式子出发,把它整理成「第一个位置只剩 $v$」的样子 $\langle v,\ \boxed{\ \cdots\ }\rangle$,方框里的东西就是 $T^*w$。例 7.2、7.3 和下面的证明都用这一招。
定理线性映射的伴随是线性映射adjoint of a linear map is a linear map7.4

若 $T\in\mathcal L(V,W)$,则 $T^*\in\mathcal L(W,V)$。

证明思路

核心:利用「代表向量是唯一的」。对任意 $v$,$\langle v,T^*(w_1+w_2)\rangle=\langle Tv,w_1+w_2\rangle=\langle Tv,w_1\rangle+\langle Tv,w_2\rangle=\langle v,T^*w_1+T^*w_2\rangle$,所以 $T^*(w_1+w_2)=T^*w_1+T^*w_2$。数乘:$\langle Tv,\lambda w\rangle=\bar\lambda\langle Tv,w\rangle=\bar\lambda\langle v,T^*w\rangle=\langle v,\lambda T^*w\rangle$——两次共轭互相抵消,得 $T^*(\lambda w)=\lambda T^*w$。

定理伴随的性质properties of the adjoint7.5

设 $T\in\mathcal L(V,W)$,则:

  • (a) $(S+T)^*=S^*+T^*$;(b) $(\lambda T)^*=\bar\lambda\,T^*$;(c) $(T^*)^*=T$;
  • (d) $(ST)^*=T^*S^*$($S\in\mathcal L(W,U)$)——顺序颠倒,就像「先穿袜子再穿鞋,脱的时候先脱鞋」;
  • (e) $I^*=I$;(f) 若 $T$ 可逆,则 $T^*$ 也可逆,且 $(T^*)^{-1}=(T^{-1})^*$。
证明思路

每一条都用同一招:把 $\langle(\cdots)v,w\rangle$ 整理成 $\langle v,\cdots\rangle$。例如 (d):$\langle STv,u\rangle=\langle Tv,S^*u\rangle=\langle v,T^*S^*u\rangle$。(c):$\langle T^*w,v\rangle=\overline{\langle v,T^*w\rangle}=\overline{\langle Tv,w\rangle}=\langle w,Tv\rangle$,所以 $(T^*)^*v=Tv$。(f):对 $T^{-1}T=I$ 与 $TT^{-1}=I$ 两边取伴随并用 (d)(e)。

注意 (b) 里的共轭:当 $\mathbf F=\mathbf R$ 时,$T\mapsto T^*$ 是从 $\mathcal L(V,W)$ 到 $\mathcal L(W,V)$ 的线性映射;当 $\mathbf F=\mathbf C$ 时它不是线性的(是「共轭线性」的)。

伴随最有用的性质之一,是它把 $T$ 的零空间、值域与 $T^*$ 的零空间、值域用正交补联系起来:

定理$T^*$ 的零空间与值域null space and range of $T^*$7.6

设 $T\in\mathcal L(V,W)$,则

  • (a) $\operatorname{null}T^*=(\operatorname{range}T)^\perp$;(b) $\operatorname{range}T^*=(\operatorname{null}T)^\perp$;
  • (c) $\operatorname{null}T=(\operatorname{range}T^*)^\perp$;(d) $\operatorname{range}T=(\operatorname{null}T^*)^\perp$。
证明思路

(a) 是一串「当且仅当」:$T^*w=0\iff\langle v,T^*w\rangle=0\ \forall v\iff\langle Tv,w\rangle=0\ \forall v\iff w\perp\operatorname{range}T$。其余三条都由 (a) 得到:两边取正交补得 (d)(用 6.52:$(U^\perp)^\perp=U$);把 $T$ 换成 $T^*$(用 $(T^*)^*=T$)得 (c);再把 (d) 中的 $T$ 换成 $T^*$ 得 (b)。

(a) 的直觉:$w$ 被 $T^*$ 压成 0,恰好是因为 $w$ 与 $T$ 的一切输出都垂直——用 $w$ 去量任何 $Tv$ 都得 0,它的代表向量当然是 0。把四条合起来看,就得到下面这幅「四个子空间」的图:

V(定义域) W(到达空间) range T* = (null T)⊥ null T T 把它压成 0 range T null T* = (range T)⊥ T* 把它压成 0 T 把 range T* 一对一地映满 range T
7.6 的几何图像(示意):$V=\operatorname{null}T\oplus\operatorname{range}T^*$,$W=\operatorname{range}T\oplus\operatorname{null}T^*$,每一对都互相垂直。

接下来看矩阵。先定义矩阵版的「伴随」:

定义共轭转置conjugate transpose, $A^*$7.7

$m\times n$ 矩阵 $A$ 的共轭转置 $A^*$ 是 $n\times m$ 矩阵:先交换行和列,再把每个元素取复共轭,即 $(A^*)_{j,k}=\overline{A_{k,j}}$。实矩阵的共轭转置就是转置 $A^{\mathrm t}$。

例一个 2×3 矩阵的共轭转置7.8

$\begin{pmatrix} 2 & 3+4i & 7 \\ 6 & 5 & 8i\end{pmatrix}^{*}=\begin{pmatrix} 2 & 6 \\ 3-4i & 5 \\ 7 & -8i\end{pmatrix}.$

定理$T^*$ 的矩阵 = $T$ 的矩阵的共轭转置matrix of $T^*$ equals conjugate transpose of matrix of $T$7.9

设 $e_1,\dots,e_n$ 是 $V$ 的规范正交基,$f_1,\dots,f_m$ 是 $W$ 的规范正交基,则

$$\mathcal M\big(T^*,(f_1,\dots,f_m),(e_1,\dots,e_n)\big)=\Big(\mathcal M\big(T,(e_1,\dots,e_n),(f_1,\dots,f_m)\big)\Big)^{*}.$$
证明思路

关键一步:在规范正交基下,$Te_k=\langle Te_k,f_1\rangle f_1+\cdots+\langle Te_k,f_m\rangle f_m$(6.30),所以 $\mathcal M(T)$ 第 $j$ 行第 $k$ 列的元素就是 $\langle Te_k,f_j\rangle$。同理 $\mathcal M(T^*)$ 的 $(j,k)$ 元是 $\langle T^*f_k,e_j\rangle=\langle f_k,Te_j\rangle=\overline{\langle Te_j,f_k\rangle}$,恰是 $\mathcal M(T)$ 的 $(k,j)$ 元的共轭。

常见误区 7.9 要求两边都是规范正交基。换成一般的基,$T^*$ 的矩阵不一定是 $T$ 的矩阵的共轭转置(习题 7A.14 给了一个「矩阵对称但算子不自伴」的例子)。这也是 Axler 偏爱「伴随」而不是「转置」的原因:伴随不依赖于基的选取。
与对偶映射的联系 利用 Riesz 表示定理把 $V$ 与对偶空间 $V'$ 等同起来(6.58),正交补 $U^\perp$ 对应零化子 $U^0$,伴随 $T^*$ 对应对偶映射 $T'$(3.118,见习题 7A.32)。于是 7.6(a)(b) 对应 3.128(a)、3.130(b),7.9 对应 3.132。在内积空间里,正交补和伴随比零化子和对偶映射好用得多,所以不必再用后者。
伴随的几何:「用 $w$ 量 $Tv$」的等值线垂直于 $T^*w$

左图是定义域 $V$,右图是到达空间 $W$(都是 $\mathbf R^2$)。拖动左图的绿色 $v$ 和右图的红色 $w$,或换一个矩阵。右图的彩色条纹是函数 $u\mapsto\langle u,w\rangle$ 的等值线(蓝色为正、橙色为负,相邻两条相差 1);左图的条纹是函数 $v\mapsto\langle Tv,w\rangle$ 的等值线;紫色箭头是 $T^*w$。

无论怎么拖,$v$ 在左图所在条纹的编号总等于 $Tv$ 在右图所在条纹的编号——这就是 $\langle Tv,w\rangle=\langle v,T^*w\rangle$。左图的条纹始终垂直于 $T^*w$、间距为 $1/\|T^*w\|$:$T^*w$ 正是泛函 $v\mapsto\langle Tv,w\rangle$ 的 Riesz 代表向量。读数里 $T^*$ 的矩阵永远是 $T$ 的矩阵的转置(7.9)。选「秩 1」并点「让 $w\perp\operatorname{range}T$」:此时 $T^*w=0$,左图条纹消失——这就是 7.6(a):$\operatorname{null}T^*=(\operatorname{range}T)^\perp$。

关于「伴随的矩阵」,下列哪个说法正确?

自伴算子 Self-Adjoint Operators

从现在起把目光转向算子,即从 $V$ 到 $V$ 自身的线性映射。这时 $T$ 与 $T^*$ 住在同一个空间 $\mathcal L(V)$ 里,可以拿来比较。

定义自伴self-adjoint7.10

算子 $T\in\mathcal L(V)$ 称为自伴的,如果 $T=T^*$;等价地,$\langle Tv,w\rangle=\langle v,Tw\rangle$ 对所有 $v,w\in V$ 成立。

由 7.9,在任一规范正交基下:$T$ 自伴 ⟺ 它的矩阵等于自己的共轭转置(实情形:对称矩阵;复情形常称 Hermitian 矩阵)。

例由矩阵判断是否自伴7.11

设 $c\in\mathbf F$,$\mathcal M(T)=\begin{pmatrix} 2 & c \\ 3 & 7\end{pmatrix}$(标准基)。则 $\mathcal M(T^*)=\begin{pmatrix} 2 & 3 \\ \bar c & 7\end{pmatrix}$,二者相等当且仅当 $c=3$。所以 $T$ 自伴 ⟺ $c=3$。

Axler 建议时刻记住一个类比:$\mathcal L(V)$ 上的伴随,扮演的角色很像 $\mathbf C$ 上的复共轭。复数 $z$ 是实数 ⟺ $z=\bar z$;所以自伴算子($T=T^*$)就相当于「实数」。整章都在丰富这张对照表:

复数世界 $\mathbf C$算子世界 $\mathcal L(V)$特征值落在出处
共轭 $\bar z$伴随 $T^*$($T^*$ 的特征值是 $T$ 的共轭)7.1,习题 7A.3
实数:$z=\bar z$自伴:$T=T^*$$\mathbf R$7.10, 7.12
$z=a+ib$(实部、虚部)$T=A+iB$,$A,B$ 自伴—7.23
非负数:$z=\bar w w$正算子:$T=R^*R$$[0,\infty)$7.34, 7.38
唯一的非负平方根唯一的正平方根 $\sqrt T$—7.39
单位圆:$\bar z z=1$酉算子:$S^*S=I$$\{|\lambda|=1\}$7.53, 7.54
$z=\dfrac{z}{|z|}\cdot|z|$极分解:$T=S\sqrt{T^*T}$—7.93

类比本身不是定理,但它一次次「预言」了正确的结果。第一个例子就是特征值:

定理自伴算子的特征值是实数eigenvalues of self-adjoint operators7.12

自伴算子的每个特征值都是实数。

证明思路

设 $Tv=\lambda v$,$v\ne0$。把 $T$ 从左边搬到右边:$\lambda\|v\|^2=\langle Tv,v\rangle=\langle v,Tv\rangle=\bar\lambda\|v\|^2$,所以 $\lambda=\bar\lambda$。($\mathbf F=\mathbf R$ 时特征值本来就是实数,这个结果在 $\mathbf F=\mathbf C$ 时才有内容。)

下面三个结果讨论量 $\langle Tv,v\rangle$(「$Tv$ 在 $v$ 方向上的分量」乘以 $\|v\|$)。它在后面定义正算子时是主角。

定理对所有 $v$ 都有 $Tv\perp v$ ⟺ $T=0$(假设 $\mathbf F=\mathbf C$)$Tv$ is orthogonal to $v$ for all $v$ ⟺ $T=0$ (assuming $\mathbf F=\mathbf C$)7.13

设 $V$ 是复内积空间,$T\in\mathcal L(V)$,则 $\langle Tv,v\rangle=0$ 对所有 $v\in V$ 成立 ⟺ $T=0$。

证明思路

复空间里有一个「极化恒等式」,能用形如 $\langle Tv,v\rangle$ 的量拼出任意的 $\langle Tu,w\rangle$:

$$\langle Tu,w\rangle=\frac{\langle T(u+w),u+w\rangle-\langle T(u-w),u-w\rangle}{4}+\frac{\langle T(u+iw),u+iw\rangle-\langle T(u-iw),u-iw\rangle}{4}\,i .$$

若所有 $\langle Tv,v\rangle=0$,右边全为 0,于是 $\langle Tu,w\rangle=0$ 对所有 $u,w$ 成立;取 $w=Tu$ 得 $Tu=0$。

常见误区:实空间里这个结论是错的 $\mathbf R^2$ 上逆时针旋转 $90^\circ$:$T(x,y)=(-y,x)$。每个 $Tv$ 都与 $v$ 垂直,所以 $\langle Tv,v\rangle\equiv0$,但 $T\ne0$。实空间缺少上面公式里带 $i$ 的那两项,拼不出所有的 $\langle Tu,w\rangle$。
定理$\langle Tv,v\rangle$ 对所有 $v$ 都是实数 ⟺ $T$ 自伴(假设 $\mathbf F=\mathbf C$)$\langle Tv,v\rangle$ is real for all $v$ ⟺ $T$ is self-adjoint7.14

设 $V$ 是复内积空间,$T\in\mathcal L(V)$,则 $T$ 自伴 ⟺ 对每个 $v\in V$,$\langle Tv,v\rangle\in\mathbf R$。——正如「$z$ 是实数 ⟺ $z=\bar z$」。

证明思路

先注意 $\langle T^*v,v\rangle=\overline{\langle Tv,v\rangle}$ 7.15。于是 $T$ 自伴 ⟺ $T-T^*=0$ ⟺(用 7.13)$\langle(T-T^*)v,v\rangle=0\ \forall v$ ⟺ $\langle Tv,v\rangle-\overline{\langle Tv,v\rangle}=0\ \forall v$ ⟺ 所有 $\langle Tv,v\rangle$ 都是实数。

定理$T$ 自伴且对所有 $v$ 有 $\langle Tv,v\rangle=0$ ⟺ $T=0$$T$ self-adjoint and $\langle Tv,v\rangle=0$ for all $v$ ⟺ $T=0$7.16

设 $T$ 是 $V$ 上的自伴算子($\mathbf F=\mathbf R$ 或 $\mathbf C$ 均可),则 $\langle Tv,v\rangle=0$ 对所有 $v$ 成立 ⟺ $T=0$。

证明思路

复情形已由 7.13 解决(甚至不需要自伴)。实情形:自伴性给出 $\langle Tw,u\rangle=\langle w,Tu\rangle=\langle Tu,w\rangle$,于是实版本的极化恒等式成立:

$$\langle Tu,w\rangle=\frac{\langle T(u+w),u+w\rangle-\langle T(u-w),u-w\rangle}{4}. \qquad\text{(7.17)}$$

右边每一项都是 $\langle Tv,v\rangle$ 型的,全为 0;再取 $w=Tu$ 即得 $T=0$。

小结一下:在实空间里,旋转 $90^\circ$ 这样的非零算子也能让 $\langle Tv,v\rangle\equiv0$;但只要加上「自伴」,这种事就不会发生。7.16 会在 7.20、7.49 的证明里反复出场。

正规算子 Normal Operators

定义正规normal7.18

内积空间上的算子称为正规的,如果它与自己的伴随可交换:$TT^*=T^*T$。

自伴算子当然是正规的($T^*=T$ 与 $T$ 自然可交换)。但正规算子要多得多:

例正规但不自伴的算子7.19

$\mathcal M(T)=\begin{pmatrix} 2 & -3 \\ 3 & 2\end{pmatrix}$,即 $T(w,z)=(2w-3z,\ 3w+2z)$。它不自伴($(2,1)$ 元 $3$ 不等于 $(1,2)$ 元 $-3$ 的共轭),但

$\begin{pmatrix} 2 & -3 \\ 3 & 2\end{pmatrix}\begin{pmatrix} 2 & 3 \\ -3 & 2\end{pmatrix}=\begin{pmatrix} 13 & 0 \\ 0 & 13\end{pmatrix}=\begin{pmatrix} 2 & 3 \\ -3 & 2\end{pmatrix}\begin{pmatrix} 2 & -3 \\ 3 & 2\end{pmatrix},$

所以 $TT^*=T^*T$,$T$ 是正规的。几何上($\mathbf F=\mathbf R$)它是「旋转 $\arctan\frac32\approx56.3^\circ$ 再放大 $\sqrt{13}$ 倍」;把 $\mathbf R^2$ 看成复平面,它就是「乘以复数 $2+3i$」。

正规性有一个很好用的「长度」刻画:

定理$T$ 正规 ⟺ $Tv$ 与 $T^*v$ 的长度相同$T$ is normal if and only if $Tv$ and $T^*v$ have the same norm7.20

设 $T\in\mathcal L(V)$,则 $T$ 正规 ⟺ 对每个 $v\in V$,$\|Tv\|=\|T^*v\|$。

证明思路

$T^*T-TT^*$ 是自伴的,由 7.16:它为 0 ⟺ $\langle(T^*T-TT^*)v,v\rangle=0\ \forall v$ ⟺ $\langle Tv,Tv\rangle=\langle T^*v,T^*v\rangle\ \forall v$ ⟺ $\|Tv\|^2=\|T^*v\|^2\ \forall v$。

正规 ⟺ $\|Tv\|=\|T^*v\|$:一族矩阵 $T=\begin{pmatrix} 1 & 1 \\ t & 1\end{pmatrix}$

拖动滑块 $t$;在左图中沿单位圆拖动绿色的 $v$。蓝箭头是 $Tv$,红箭头是 $T^*v$,淡色椭圆是单位圆在 $T$、$T^*$ 下的像,紫色虚线是实特征方向。右图画出 $v$ 转一圈(半圈即可)时 $\|Tv\|$(蓝实线)与 $\|T^*v\|$(红虚线)的变化。

$TT^*-T^*T=\begin{pmatrix} 1-t^2 & 0 \\ 0 & t^2-1\end{pmatrix}$,所以只有 $t=\pm1$ 时 $T$ 正规——恰好也只有这两个位置,两条曲线完全重合。$t=1$ 时 $T$ 对称,两条特征方向互相垂直(7.22);$0\lt t\ne1$ 时特征方向不垂直;$t=0$ 时只剩一条特征方向;$t\lt0$ 时特征值是共轭复数 $1\pm i\sqrt{|t|}$,实平面里没有特征方向。

正规性带来一连串好性质:

定理正规算子的值域、零空间与特征向量range, null space, and eigenvectors of a normal operator7.21

设 $T\in\mathcal L(V)$ 正规,则

  • (a) $\operatorname{null}T=\operatorname{null}T^*$;(b) $\operatorname{range}T=\operatorname{range}T^*$;
  • (c) $V=\operatorname{null}T\oplus\operatorname{range}T$(而且是正交直和);
  • (d) 对每个 $\lambda\in\mathbf F$,$T-\lambda I$ 也正规;
  • (e) $Tv=\lambda v\iff T^*v=\bar\lambda v$——正规算子与它的伴随有相同的特征向量(特征值取共轭)。
证明思路

(a) $\|Tv\|=0\iff\|T^*v\|=0$(7.20)。(b) $\operatorname{range}T=(\operatorname{null}T^*)^\perp=(\operatorname{null}T)^\perp=\operatorname{range}T^*$(7.6)。(c) $V=\operatorname{null}T\oplus(\operatorname{null}T)^\perp=\operatorname{null}T\oplus\operatorname{range}T^*=\operatorname{null}T\oplus\operatorname{range}T$。(d) 展开 $(T-\lambda I)(T^*-\bar\lambda I)$ 与 $(T^*-\bar\lambda I)(T-\lambda I)$,差别只在 $TT^*$ 与 $T^*T$。(e) 对正规算子 $T-\lambda I$ 用 7.20:$\|(T-\lambda I)v\|=\|(T^*-\bar\lambda I)v\|$,一个为 0 当且仅当另一个为 0。

对比:对一般算子,$T^*$ 的特征值恰是 $T$ 的特征值的共轭(习题 7A.3),但二者的特征向量可以完全不同(例如剪切)。(e) 说明正规算子没有这个问题。由此立刻得到下一节谱定理的关键零件:

定理正规算子的特征向量互相正交orthogonal eigenvectors for normal operators7.22

设 $T\in\mathcal L(V)$ 正规,则 $T$ 属于不同特征值的特征向量互相正交。

证明思路

设 $Tu=\alpha u$、$Tv=\beta v$、$\alpha\ne\beta$。由 7.21(e),$T^*v=\bar\beta v$。于是 $(\alpha-\beta)\langle u,v\rangle=\langle\alpha u,v\rangle-\langle u,\bar\beta v\rangle=\langle Tu,v\rangle-\langle u,T^*v\rangle=0$,故 $\langle u,v\rangle=0$。

最后是类比表中「实部、虚部」那一行。$\mathbf F=\mathbf C$ 时,任何算子都可以写成

$$T=A+iB,\qquad A=\frac{T+T^*}{2},\quad B=\frac{T-T^*}{2i},$$(7.24)

其中 $A$、$B$ 都自伴(就像 $\operatorname{Re}z=\frac{z+\bar z}{2}$、$\operatorname{Im}z=\frac{z-\bar z}{2i}$)。直接计算得 $AB-BA=\dfrac{T^*T-TT^*}{2i}$ 7.25。于是:

定理$T$ 正规 ⟺ 它的实部与虚部可交换$T$ is normal ⟺ the real and imaginary parts of $T$ commute7.23

设 $\mathbf F=\mathbf C$,$T\in\mathcal L(V)$。则 $T$ 正规 ⟺ 存在可交换的自伴算子 $A$、$B$ 使 $T=A+iB$。

证明思路

若 $T$ 正规,取 7.24 的 $A$、$B$,由 7.25 知 $AB=BA$。反之若 $T=A+iB$($A$、$B$ 自伴且可交换),则 $T^*=A-iB$,由此解出的 $A$、$B$ 正是 7.24 的形式,再由 7.25 与 $AB=BA$ 得 $T^*T=TT^*$。(习题 7A.12 给出对 $\mathbf R$、$\mathbf C$ 都适用的版本:$T=A+B$,$A$ 自伴、$B$ 为 skew 算子即 $B^*=-B$。)

下列 $\mathbf R^2$ 上的算子(标准基下的矩阵)中,哪一个是正规但不自伴的?

伴随adjoint, T*满足 $\langle Tv,w\rangle=\langle v,T^*w\rangle$ 的唯一线性映射 $T^*:W\to V$;在规范正交基下矩阵是共轭转置。
共轭转置conjugate transpose交换行列并逐项取共轭:$(A^*)_{j,k}=\overline{A_{k,j}}$;实矩阵就是转置。
自伴算子self-adjoint operator$T=T^*$,即 $\langle Tv,w\rangle=\langle v,Tw\rangle$;特征值全是实数,类比实数。
正规算子normal operator$TT^*=T^*T$;等价于 $\|Tv\|=\|T^*v\|$ 对所有 $v$ 成立。
斜算子skew operator满足 $B^*=-B$ 的算子(习题 7A.12);正规时特征值都是纯虚数,类比纯虚数。
本节要点
  • $T^*$ 是「用 $w$ 量 $Tv$」这个泛函的代表向量;规范正交基下矩阵取共轭转置;$(ST)^*=T^*S^*$。
  • $\operatorname{null}T^*=(\operatorname{range}T)^\perp$,$\operatorname{range}T^*=(\operatorname{null}T)^\perp$。
  • 自伴 ↔ 实数:特征值是实的;$\mathbf F=\mathbf C$ 时 $T$ 自伴 ⟺ 所有 $\langle Tv,v\rangle$ 都是实数。
  • 正规 ⟺ $\|Tv\|=\|T^*v\|$;正规算子与伴随共享特征向量,不同特征值的特征向量互相垂直。

7B 谱定理 Spectral Theorem

这一节要回答本章最核心的问题:什么样的算子,能被一组互相垂直的单位向量完全「看透」?回忆:算子可对角化 ⟺ 有一组由特征向量构成的基(5.55)。最理想的情况是这组基还是规范正交的——此时算子只是沿几条互相垂直的轴各自伸缩。谱定理给出了精确答案:$\mathbf F=\mathbf R$ 时恰是自伴算子,$\mathbf F=\mathbf C$ 时恰是正规算子。

直觉:规范正交特征基有多好用 若 $e_1,\dots,e_n$ 是规范正交基且 $Te_k=\lambda_ke_k$,那么对任意 $v$,先把它分解成 $v=\langle v,e_1\rangle e_1+\cdots+\langle v,e_n\rangle e_n$,就有

$Tv=\lambda_1\langle v,e_1\rangle e_1+\cdots+\lambda_n\langle v,e_n\rangle e_n .$

「求坐标」只需要做内积,「作用 $T$」只需要把每个坐标乘以 $\lambda_k$。这个公式的样子请记住——7E 的奇异值分解会把它推广到任意线性映射。

谱定理(spectral theorem)大概是研究内积空间上算子最有用的工具;它在某些无穷维空间上的推广是泛函分析的支柱。由于结论依赖于 $\mathbf F$,我们把它拆成实、复两部分。

实谱定理 Real Spectral Theorem

证明实谱定理需要两个准备结果(它们在实、复空间都成立)。第一个来自中学的配方:若 $b,c\in\mathbf R$ 且 $b^2\lt 4c$,则对任意实数 $x$,

$x^2+bx+c=\big(x+\tfrac b2\big)^2+\big(c-\tfrac{b^2}{4}\big)\gt 0$,所以它是一个「可逆」的(非零)实数。

把实数 $x$ 换成「像实数的算子」——自伴算子,就得到:

定理可逆的二次表达式invertible quadratic expressions7.26

设 $T\in\mathcal L(V)$ 自伴,$b,c\in\mathbf R$ 且 $b^2\lt 4c$,则 $T^2+bT+cI$ 是可逆算子。

证明思路

对非零 $v$,用自伴性 $\langle T^2v,v\rangle=\|Tv\|^2$ 和 Cauchy–Schwarz(6.14),照着配方做:

$\langle(T^2+bT+cI)v,v\rangle\ \ge\ \|Tv\|^2-|b|\,\|Tv\|\,\|v\|+c\|v\|^2=\Big(\|Tv\|-\tfrac{|b|\,\|v\|}{2}\Big)^2+\Big(c-\tfrac{b^2}{4}\Big)\|v\|^2\gt 0 .$

所以 $(T^2+bT+cI)v\ne0$,即它是单射,从而可逆(3.65)。

(习题 7B.18 说明「自伴」这个假设不能去掉:$\mathbf R^2$ 上旋转 $90^\circ$ 满足 $T^2+I=0$。)

定理自伴算子的极小多项式minimal polynomial of self-adjoint operator7.27

设 $T\in\mathcal L(V)$ 自伴,则 $T$ 的极小多项式形如 $(z-\lambda_1)\cdots(z-\lambda_m)$,其中 $\lambda_1,\dots,\lambda_m\in\mathbf R$。

证明思路

$\mathbf F=\mathbf C$:极小多项式的零点就是特征值(5.27),而特征值全是实数(7.12)。$\mathbf F=\mathbf R$:实多项式可以分解成一次因式与「$b^2\lt 4c$ 的二次因式」之积(4.16)7.28。如果极小多项式里真有二次因式 $z^2+b_Nz+c_N$,由 7.26 它对应的算子可逆,把它从 $p(T)=0$ 中「除掉」就得到一个次数更低、同样零化 $T$ 的多项式,与极小性矛盾。所以只剩一次因式。

由 7.27 与 5.27(a),每个自伴算子都有特征值——即使在实空间里!(对比:旋转 $90^\circ$ 在 $\mathbf R^2$ 中一个特征值也没有。)其实更强:特征向量多到可以组成一组规范正交基。

定理实谱定理real spectral theorem7.29

设 $\mathbf F=\mathbf R$,$T\in\mathcal L(V)$。以下三条等价:

  • (a) $T$ 自伴;
  • (b) $T$ 关于 $V$ 的某个规范正交基有对角矩阵;
  • (c) $V$ 有一组由 $T$ 的特征向量构成的规范正交基。
证明思路

(a)⇒(b):由 7.27,极小多项式只有一次因式,再由 6.37,$T$ 关于某个规范正交基有上三角矩阵。在规范正交基下 $T^*$ 的矩阵是转置(7.9),而 $T^*=T$,所以这个上三角矩阵等于它的转置——上三角又对称,只能是对角的。(b)⇒(a):对角矩阵等于自己的转置,所以 $T^*=T$。(b)⟺(c):由定义(或见 5.55)。

几何上,实谱定理说的是:自伴算子 = 沿某几条互相垂直的轴各自伸缩(系数可以是负数,即翻转)。在 $\mathbf R^2$ 中,它把单位圆变成一个椭圆,椭圆的两条主轴恰好是两个互相垂直的特征向量,半轴长是 $|\lambda_1|$、$|\lambda_2|$。动手看看,并和不对称的矩阵比一比:

实谱定理的图像:对称矩阵 → 椭圆的主轴就是特征向量

用滑块设定矩阵 $\begin{pmatrix} a & b \\ b+\varepsilon & d\end{pmatrix}$($\varepsilon=0$ 时对称)。沿单位圆拖动绿色的 $v$:转到特征方向附近时会自动吸附,$v$ 变成紫色、$Tv$ 与 $v$ 共线。蓝色区域是单位圆盘的像;紫色箭头是 $\lambda_kq_k$;勾选「特征基网格」可以看到以特征向量为轴的网格被怎样变形。

$\varepsilon=0$ 时,两条特征方向永远互相垂直,并且正好是椭圆的长、短轴;原来的正方形网格(沿 $q_1,q_2$)被变成长方形网格——没有任何「剪切」,这就是「关于规范正交基 $q_1,q_2$ 的矩阵是对角的」。把 $d$ 拉成负数,可以让一个特征值变负:$T$ 在那条特征方向上把向量翻到反面,但椭圆只看 $|\lambda|$——半轴仍是 $|\lambda_1|,|\lambda_2|$,主轴仍是两条特征方向。拉动 $\varepsilon$ 破坏对称:特征方向不再垂直,网格被斜着拉,椭圆的主轴(绿色)也和特征方向分道扬镳——绿色主轴其实是 7E 的「奇异向量」。

例一个算子的规范正交特征基7.30

设 $T\in\mathcal L(\mathbf R^3)$ 在标准基下的矩阵为 $\begin{pmatrix} 14 & -13 & 8 \\ -13 & 14 & 8 \\ 8 & 8 & -7\end{pmatrix}$。它是实对称矩阵,所以 $T$ 自伴。可以验证

$\dfrac{(1,-1,0)}{\sqrt2},\quad\dfrac{(1,1,1)}{\sqrt3},\quad\dfrac{(1,1,-2)}{\sqrt6}$

是由 $T$ 的特征向量组成的规范正交基(对应特征值 $27,\ 9,\ -15$);在这组基下 $\mathcal M(T)=\operatorname{diag}(27,9,-15)$。例如 $T(1,1,1)=(9,9,9)$。

(习题 7B.17 把实谱定理推广到一族两两可交换的自伴算子:它们可以被同一组规范正交基同时对角化。)

复谱定理 Complex Spectral Theorem

在复空间里,条件可以放宽到「正规」:

定理复谱定理complex spectral theorem7.31

设 $\mathbf F=\mathbf C$,$T\in\mathcal L(V)$。以下三条等价:

  • (a) $T$ 正规;
  • (b) $T$ 关于 $V$ 的某个规范正交基有对角矩阵;
  • (c) $V$ 有一组由 $T$ 的特征向量构成的规范正交基。

证明的核心是一个漂亮的「逐行清零」论证:先用 Schur 定理把矩阵变成上三角,再用 $\|Te_k\|=\|T^*e_k\|$(7.20)一行一行地证明对角线以上全是 0。用步骤播放器走一遍(以 $4\times4$ 为例):

第 0 步:Schur 定理——先上三角化

由 Schur 定理(6.38),存在规范正交基 $e_1,\dots,e_n$,使 $\mathcal M(T)$ 是上三角矩阵 7.32。我们要证明:$T$ 正规时,这个矩阵其实是对角的。

第 1 步:比较第 1 列与第 1 行

$Te_1$ 的坐标是第 1 列,只有 $a_{1,1}$,所以 $\|Te_1\|^2=|a_{1,1}|^2$。$T^*e_1$ 的坐标是 $\mathcal M(T^*)$ 的第 1 列,即 $\mathcal M(T)$ 第 1 行的共轭,所以 $\|T^*e_1\|^2=|a_{1,1}|^2+|a_{1,2}|^2+\cdots+|a_{1,n}|^2$。正规 ⇒ 二者相等 ⇒ 第 1 行除 $a_{1,1}$ 外全为 0。

第 2 步:第 2 列现在只剩 $a_{2,2}$

因为 $a_{1,2}$ 已经是 0,$\|Te_2\|^2=|a_{2,2}|^2$;而 $\|T^*e_2\|^2=|a_{2,2}|^2+|a_{2,3}|^2+\cdots+|a_{2,n}|^2$。再用 $\|Te_2\|=\|T^*e_2\|$ ⇒ 第 2 行的非对角元全为 0。

第 3 步:照此继续

每一步都是同一个论证:上面各行已清零,所以第 $k$ 列只剩 $a_{k,k}$;比较第 $k$ 列与第 $k$ 行的长度,第 $k$ 行的非对角元全为 0。

第 4 步:得到对角矩阵;反方向更容易

所有非对角元都是 0,(a)⇒(b) 证完。反过来,若 $T$ 关于某个规范正交基是对角矩阵,那么 $T^*$ 的矩阵是它的共轭转置——也是对角的;对角矩阵彼此可交换,所以 $TT^*=T^*T$。(b)⟺(c) 由定义即得。

例一个算子的规范正交特征基7.33

设 $T(w,z)=(2w-3z,\ 3w+2z)$,$\mathcal M(T)=\begin{pmatrix} 2 & -3 \\ 3 & 2\end{pmatrix}$,由例 7.19 它是正规的。可以验证

$u_1=\tfrac{1}{\sqrt2}(i,1),\qquad u_2=\tfrac{1}{\sqrt2}(-i,1)$

是 $\mathbf C^2$ 的规范正交基,由 $T$ 的特征向量组成,且在这组基下 $\mathcal M(T)=\begin{pmatrix} 2+3i & 0 \\ 0 & 2-3i\end{pmatrix}$。

复平面上的直观。把 $v$ 写成 $v=z_1u_1+z_2u_2$,那么 $Tv=(2+3i)z_1u_1+(2-3i)z_2u_2$:两个坐标各自住在自己的复平面里,互不干扰地被乘上一个复数——乘以 $\lambda=re^{i\theta}$ 就是「旋转 $\theta$、放大 $r$ 倍」。这就是正规算子在复谱定理下的全部面貌:

Re Im +56.3° 2+3i 1 坐标 z₁(沿 u₁)× (2+3i) 旋转 +56.3°,放大 √13 ≈ 3.61 倍 Re Im −56.3° 2−3i 1 坐标 z₂(沿 u₂)× (2−3i) 旋转 −56.3°,放大 √13 ≈ 3.61 倍
例 7.33:在规范正交特征基 $u_1,u_2$ 下,$T$ 把坐标 $z_1$ 乘以 $2+3i$、把坐标 $z_2$ 乘以 $2-3i$(灰色小旗是 $1$,彩色小旗是它的像)。7F 末尾的演示会让你拖动特征值,看它们的位置怎样决定算子的性质。
常见误区:为什么实的情形要「自伴」,复的只要「正规」? 把同一个矩阵 $\begin{pmatrix} 2 & -3 \\ 3 & 2\end{pmatrix}$ 放到 $\mathbf R^2$ 上:它仍然正规,但它是「旋转 + 放大」,在 $\mathbf R^2$ 中一个特征向量都没有,更谈不上规范正交特征基。复数给了特征值「住处」($2\pm3i$),所以复谱定理只需要正规;在实数里,特征值必须本身就是实的,这正是自伴所保证的(7.12、7.27)。
实谱定理 7.29复谱定理 7.31
条件$\mathbf F=\mathbf R$,$T$ 自伴$\mathbf F=\mathbf C$,$T$ 正规
结论存在由特征向量构成的规范正交基 ⟺ 关于某规范正交基的矩阵是对角的
对角线上实数复数(自伴时是实数)
证明的关键7.27(极小多项式无二次因式)+ 上三角化 + 对称Schur 上三角化 + $\|Te_k\|=\|T^*e_k\|$ 逐行清零
几何图像沿互相垂直的轴伸缩(可翻转)在每个正交方向上乘一个复数(旋转 + 伸缩)

习题 7B.13、7B.20 给出 (a)⇒(b) 的另两种证明;习题 7B.14、7B.15 把谱定理改写为「$V$ 是各特征空间的正交直和」;习题 7B.16 把复谱定理推广到一族两两可交换的正规算子。

实谱定理:设 $\mathbf F=\mathbf R$。$V$ 有一组由 $T$ 的特征向量构成的规范正交基,当且仅当 $T$ 满足什么?

把旋转 90° 的矩阵 $\begin{pmatrix} 0 & -1 \\ 1 & 0\end{pmatrix}$ 看作 $\mathbf C^2$ 上的算子,它能被一组规范正交基对角化吗?

实谱定理real spectral theorem$\mathbf F=\mathbf R$:$T$ 自伴 ⟺ $V$ 有由 $T$ 的特征向量构成的规范正交基。
复谱定理complex spectral theorem$\mathbf F=\mathbf C$:$T$ 正规 ⟺ $V$ 有由 $T$ 的特征向量构成的规范正交基。
本节要点
  • 「能被规范正交基对角化」的算子:实空间里恰是自伴算子,复空间里恰是正规算子。
  • 自伴算子的极小多项式只有实的一次因式,所以(即使在实空间)一定有特征值。
  • 图像:自伴 = 沿互相垂直的轴伸缩;正规(复)= 在每个正交方向上乘一个复数。

7C 正算子 Positive Operators

这一节把类比表里的「非负数」搬进算子世界。非负数有三个等价的特征:有非负平方根、有实平方根、能写成 $\bar ww$。正算子恰好有对应的三条刻画(7.38),而且也有唯一的「非负」平方根 $\sqrt T$(7.39)。$\sqrt T$ 是后面奇异值分解与极分解里 $\sqrt{T^*T}$ 的来源。

直觉:$\langle Tv,v\rangle\ge0$ 在图上是什么意思 $\langle Tv,v\rangle$ 是「$Tv$ 在 $v$ 方向上的分量 × $\|v\|$」。所以 $\langle Tv,v\rangle\ge0$ 说的是:$Tv$ 从来不会指向与 $v$ 成钝角的方向——$T$ 可以把 $v$ 拉长、压短、偏转,但偏转永远不超过 $90^\circ$。在 $\mathbf R^n$ 中,$v\mapsto\langle Tv,v\rangle$ 是一个二次型,正算子对应一个「碗」:处处 ≥ 0。
定义正算子positive operator7.34

算子 $T\in\mathcal L(V)$ 称为正的,如果 $T$ 自伴,并且对所有 $v\in V$ 有 $\langle Tv,v\rangle\ge0$。

若 $V$ 是复空间,定义中的「自伴」可以去掉——由 7.14,$\langle Tv,v\rangle$ 全是实数已经蕴含自伴。

术语提醒 正算子对应的是非负数,按理应叫 nonnegative operator;但算子理论界一直叫 positive operator,本书也照此沿用。有些书叫半正定算子(positive semidefinite operator),意思相同。7D 中的「正定」(positive definite)才对应严格的「$\gt0$」。
例正算子positive operators7.35
  • (a) $\mathcal M(T)=\begin{pmatrix} 2 & -1 \\ -1 & 1\end{pmatrix}$:$T$ 自伴,且 $\langle T(w,z),(w,z)\rangle=2|w|^2-2\operatorname{Re}(w\bar z)+|z|^2=|w-z|^2+|w|^2\ge0$,所以 $T$ 是正算子。
  • (b) 若 $U$ 是 $V$ 的子空间,则正交投影 $P_U$ 是正算子:$\langle P_Uv,v\rangle=\langle P_Uv,P_Uv\rangle=\|P_Uv\|^2\ge0$。
  • (c) 若 $T$ 自伴且 $b^2\lt 4c$,则 $T^2+bT+cI$ 是正算子(7.26 的证明里已经算过)。
定义平方根square root7.36

若 $R^2=T$,称算子 $R$ 是算子 $T$ 的一个平方根。

例一个算子的平方根7.37

$T(z_1,z_2,z_3)=(z_3,0,0)$ 有平方根 $R(z_1,z_2,z_3)=(z_2,z_3,0)$:$R^2(z_1,z_2,z_3)=R(z_2,z_3,0)=(z_3,0,0)$。(这里的 $T$ 不是正算子——平方根的概念本身不要求正。)

定理正算子的刻画characterizations of positive operators7.38

设 $T\in\mathcal L(V)$。以下六条等价:

  • (a) $T$ 是正算子;
  • (b) $T$ 自伴,且 $T$ 的所有特征值都 ≥ 0;
  • (c) 关于 $V$ 的某个规范正交基,$T$ 的矩阵是对角线元素全 ≥ 0 的对角矩阵;
  • (d) $T$ 有一个正的平方根;
  • (e) $T$ 有一个自伴的平方根;
  • (f) 存在 $R\in\mathcal L(V)$ 使 $T=R^*R$。
证明思路

沿 (a)⇒(b)⇒(c)⇒(d)⇒(e)⇒(f)⇒(a) 转一圈。(a)⇒(b):若 $Tv=\lambda v$,则 $0\le\langle Tv,v\rangle=\lambda\|v\|^2$。(b)⇒(c):谱定理(7.29/7.31)给出规范正交特征基。(c)⇒(d):设 $Te_k=\lambda_ke_k$,定义 $Re_k=\sqrt{\lambda_k}\,e_k$——$R$ 是正算子且 $R^2=T$。(d)⇒(e):正算子本来就自伴。(e)⇒(f):$R$ 自伴时 $T=R^2=R^*R$。(f)⇒(a):$(R^*R)^*=R^*R$,且 $\langle R^*Rv,v\rangle=\langle Rv,Rv\rangle=\|Rv\|^2\ge0$。

复数 $z$ 是非负数 ⟺算子 $T$ 是正算子 ⟺
$z$ 有非负的平方根(d) $T$ 有正的平方根
$z$ 有实的平方根(e) $T$ 有自伴的平方根
存在 $w\in\mathbf C$ 使 $z=\bar ww$(f) 存在 $R$ 使 $T=R^*R$

(c) 给出了正算子的完整图像:沿一组互相垂直的轴,各自拉伸一个非负倍数(不允许翻转)。平方根也就一目了然:同样的轴,拉伸倍数开方。

正算子与它的正平方根 $\sqrt T$

用滑块设定 $T$ 的特征值 $\lambda_1,\lambda_2$ 和第一条特征方向的角度 $\theta$(第二条自动与它垂直)。沿单位圆拖动绿色的 $v$。单位圆被染色:绿色弧上 $\langle Tv,v\rangle\ge0$,红色弧上 $\lt0$。蓝色是 $T$ 的像(椭圆与 $Tv$),紫色虚线椭圆与紫色箭头是 $\sqrt T$。

两个特征值都 ≥ 0 时,整个单位圆都是绿的,$v$ 与 $Tv$ 的夹角永远 ≤ 90°;$\sqrt T$ 的椭圆(半轴 $\sqrt{\lambda_1},\sqrt{\lambda_2}$)夹在单位圆和 $T$ 的椭圆「中间」,把 $\sqrt T$ 用两次恰好走到 $Tv$。一旦某个特征值为负,特征方向附近出现红弧,$\langle Tv,v\rangle\lt0$,$T$ 不再是正算子,也就没有自伴的平方根(7.38(e))。例 7.41 的 $T$ 有特征值 2 和 0:椭圆压扁成一条线段,$\sqrt T=\frac{1}{\sqrt2}\begin{pmatrix} 1 & 1 \\ 1 & 1\end{pmatrix}$。

定理每个正算子只有一个正平方根each positive operator has only one positive square root7.39

$V$ 上的每个正算子都有唯一的正平方根。

证明思路

设 $T$ 正,$R$ 是 $T$ 的任一个正平方根。只需证明:对 $T$ 的每个特征向量 $v$($Tv=\lambda v$),都有 $Rv=\sqrt\lambda\,v$——这样 $R$ 在一组由 $T$ 的特征向量构成的基上被唯一确定。取 $R$ 的规范正交特征基 $e_k$($Re_k=\sqrt{\lambda_k}e_k$),写 $v=\sum a_ke_k$,则 $\lambda v=Tv=R^2v=\sum a_k\lambda_ke_k$,比较系数得 $a_k(\lambda-\lambda_k)=0$:$v$ 只含 $\lambda_k=\lambda$ 的那些 $e_k$,于是 $Rv=\sum a_k\sqrt\lambda\,e_k=\sqrt\lambda\,v$。

常见误区:平方根不唯一,「正的」平方根才唯一 $\dim V\gt1$ 时,单位算子 $I$ 有无穷多个平方根:任何一个反射都满足 $R^2=I$(例如 $\mathbf R^2$ 中关于任意一条过原点直线的反射,见习题 7C.19),$-I$ 也是。但正的平方根只有 $I$ 自己。这和「$1$ 的平方根有 $\pm1$,非负的只有 $1$」一模一样。
定义记号 $\sqrt T$notation: $\sqrt T$7.40

对正算子 $T$,$\sqrt T$ 表示它唯一的正平方根。

例正算子的平方根7.41

在 $\mathbf R^2$ 上令 $S(x,y)=(x,2y)$,$T(x,y)=(x+y,\ x+y)$,即 7.42 $\mathcal M(S)=\begin{pmatrix} 1 & 0 \\ 0 & 2\end{pmatrix}$,$\mathcal M(T)=\begin{pmatrix} 1 & 1 \\ 1 & 1\end{pmatrix}$。二者都对称,且 $\langle S(x,y),(x,y)\rangle=x^2+2y^2\ge0$,$\langle T(x,y),(x,y)\rangle=(x+y)^2\ge0$,都是正算子。

$S$ 的特征向量就是标准基;$T$ 的规范正交特征基是 $\big(\tfrac1{\sqrt2},\tfrac1{\sqrt2}\big)$(特征值 2)与 $\big(\tfrac1{\sqrt2},-\tfrac1{\sqrt2}\big)$(特征值 0)。开方特征值、保持特征向量,得

$\mathcal M(\sqrt S)=\begin{pmatrix} 1 & 0 \\ 0 & \sqrt2\end{pmatrix},\qquad \mathcal M(\sqrt T)=\begin{pmatrix} \frac1{\sqrt2} & \frac1{\sqrt2} \\ \frac1{\sqrt2} & \frac1{\sqrt2}\end{pmatrix}.$

下面这个结果本身没有平方根,但最干净的证明要用到它:

定理$T$ 正且 $\langle Tv,v\rangle=0$ ⟹ $Tv=0$$T$ positive and $\langle Tv,v\rangle=0$ ⟹ $Tv=0$7.43

设 $T$ 是 $V$ 上的正算子,$v\in V$ 满足 $\langle Tv,v\rangle=0$,则 $Tv=0$。

证明思路

$0=\langle Tv,v\rangle=\langle\sqrt T\sqrt Tv,v\rangle=\langle\sqrt Tv,\sqrt Tv\rangle=\|\sqrt Tv\|^2$,所以 $\sqrt Tv=0$,从而 $Tv=\sqrt T(\sqrt Tv)=0$。

对比:对一般算子,某个 $v$ 满足 $\langle Tv,v\rangle=0$ 完全推不出 $Tv=0$(旋转 $90^\circ$ 对每个 $v$ 都如此)。在演示里也能看到:正算子的「碗」只在零空间方向上碰到 0。

补充:正算子在哪里出现
  • 任何线性映射都「附赠」一个正算子 $T^*T$(7.38(f)、7.64)。它记录了 $T$ 对长度的全部影响:$\|Tv\|^2=\langle T^*Tv,v\rangle$——7E 的奇异值就从它来。
  • 一组向量两两内积排成的 Gram 矩阵 $A^*A$ 是正的(列线性无关时正定);7D 的 Cholesky 分解分解的正是它。
  • (本书之外)统计里的协方差矩阵、优化中极小点处的 Hessian 矩阵、力学里的动能二次型,都是正算子。

下列 $\mathbf R^2$ 上的算子(标准基下的矩阵)中,哪一个是正算子?

正算子positive operator自伴且 $\langle Tv,v\rangle\ge0$;⟺ 特征值全 ≥ 0 ⟺ $T=R^*R$。类比非负数。
平方根square root满足 $R^2=T$ 的算子 $R$;一般不唯一($I$ 有无穷多个)。
正平方根positive square root, √T正算子 $T$ 唯一的正平方根:特征向量不变,特征值开方。
本节要点
  • 正算子 = 自伴 + $\langle Tv,v\rangle\ge0$ = 特征值全 ≥ 0 = 沿垂直轴作非负伸缩 = $R^*R$。
  • 每个正算子有唯一正平方根 $\sqrt T$:同样的特征向量,特征值开方。
  • $T$ 正且 $\langle Tv,v\rangle=0$ ⟹ $Tv=0$。

7D 等距映射、酉算子与矩阵分解 Isometries, Unitary Operators, and Matrix Factorization

这一节研究「不改变长度」的线性映射:等距映射,以及它的算子版本酉算子——类比表中的「单位圆」。然后转到矩阵:把 Gram–Schmidt 过程写成矩阵分解就是 QR 分解;再结合上一节的正算子,得到正定矩阵的 Cholesky 分解。

等距映射 Isometries

定义等距映射isometry7.44

线性映射 $S\in\mathcal L(V,W)$ 称为等距映射,如果对每个 $v\in V$ 有 $\|Sv\|=\|v\|$。换句话说,等距映射就是保持范数(长度)的线性映射。

希腊语 isos 意为「相等」,metron 意为「度量」,isometry 字面意思就是「等量」。等距映射一定是单射:若 $Sv=0$,则 $\|v\|=\|Sv\|=0$。

例把规范正交基送成规范正交组 ⟹ 等距orthonormal basis maps to orthonormal list ⟹ isometry7.45

设 $e_1,\dots,e_n$ 是 $V$ 的规范正交基,$g_1,\dots,g_n$ 是 $W$ 中的规范正交组,$S$ 是满足 $Se_k=g_k$ 的线性映射。对 $v=\langle v,e_1\rangle e_1+\cdots+\langle v,e_n\rangle e_n$ 7.46,有 $Sv=\langle v,e_1\rangle g_1+\cdots+\langle v,e_n\rangle g_n$。由 Parseval 恒等式(6.30(b)),$\|v\|^2$ 与 $\|Sv\|^2$ 都等于 $|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_n\rangle|^2$ 7.47 7.48,所以 $S$ 是等距。

定理等距映射的刻画characterizations of isometries7.49

设 $S\in\mathcal L(V,W)$,$e_1,\dots,e_n$ 是 $V$ 的规范正交基,$f_1,\dots,f_m$ 是 $W$ 的规范正交基。以下等价:

  • (a) $S$ 是等距映射(保长度);
  • (b) $S^*S=I$;
  • (c) $\langle Su,Sv\rangle=\langle u,v\rangle$ 对所有 $u,v$ 成立(保内积,因而保角度);
  • (d) $Se_1,\dots,Se_n$ 是 $W$ 中的规范正交组;
  • (e) $\mathcal M(S,(e_1,\dots,e_n),(f_1,\dots,f_m))$ 的各列在 $\mathbf F^m$ 中构成规范正交组。
证明思路

(a)⇒(b):$I-S^*S$ 自伴,且 $\langle(I-S^*S)v,v\rangle=\|v\|^2-\|Sv\|^2=0$,由 7.16 得 $I-S^*S=0$。(b)⇒(c):$\langle Su,Sv\rangle=\langle S^*Su,v\rangle=\langle u,v\rangle$。(c)⇒(d):取 $u,v$ 为 $e_j,e_k$。(d)⇒(e):第 $k$ 列与第 $r$ 列的内积 $\sum_j A_{j,k}\overline{A_{j,r}}=\langle Se_k,Se_r\rangle$ 7.50。(e)⇒(a):同一式子说明 $Se_1,\dots,Se_n$ 规范正交,再用例 7.45。

直觉 「保长度」看似比「保内积」弱,其实一样强:内积可以用长度拼出来(7.13、7.17 那类极化恒等式),所以长度不变,角度也就不变。另外注意 (b) 只说 $S^*S=I$:$S^*$ 是 $S$ 的左逆。当 $\dim W\gt\dim V$ 时 $SS^*\ne I$(例如把 $\mathbf R^2$ 放进 $\mathbf R^3$ 的嵌入:$SS^*$ 是到 $\operatorname{range}S$ 的正交投影)。

酉算子 Unitary Operators

现在只看从 $V$ 到自身的等距映射。

定义酉算子unitary operator7.51

算子 $S\in\mathcal L(V)$ 称为酉算子,如果 $S$ 是可逆的等距映射。

有限维时「可逆」二字是多余的:等距是单射,而有限维空间上的单射算子必可逆(3.65)。保留它是为了与无穷维的定义一致。记住区别:酉算子把空间映到自身,等距映射可以映到另一个(更大的)空间。(在实空间里,酉算子与酉矩阵也常被称为正交算子/正交矩阵(orthogonal matrix)——读其他书时会遇到。)

例$\mathbf R^2$ 的旋转rotation of $\mathbf R^2$7.52

矩阵 $\begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta\end{pmatrix}$ 的两列构成 $\mathbf F^2$ 的规范正交组,由 7.49 (a)⟺(e) 它是等距,因而是酉算子。$\mathbf F=\mathbf R$ 时它就是绕原点逆时针旋转 $\theta$——旋转当然保长度。

定理酉算子的刻画characterizations of unitary operators7.53

设 $S\in\mathcal L(V)$,$e_1,\dots,e_n$ 是 $V$ 的规范正交基。以下等价:

  • (a) $S$ 是酉算子;(b) $S^*S=SS^*=I$;(c) $S$ 可逆且 $S^{-1}=S^*$;
  • (d) $Se_1,\dots,Se_n$ 是 $V$ 的规范正交基;
  • (e) $\mathcal M(S,(e_1,\dots,e_n))$ 的各行构成 $\mathbf F^n$ 的规范正交基;
  • (f) $S^*$ 是酉算子。
证明思路

(a)⇒(b):由 7.49,$S^*S=I$;右乘 $S^{-1}$ 得 $S^*=S^{-1}$,于是 $SS^*=I$。(b)⇒(c) 按定义。(c)⇒(d):$S^*S=I$ 说明 $Se_k$ 规范正交,个数为 $\dim V$,所以是基。(d)⇒(e):此时 $S$ 是酉的,$(S^*)^*S^*=SS^*=I$,故 $S^*$ 是等距,$\mathcal M(S^*)$ 的列规范正交——它们正是 $\mathcal M(S)$ 各行的共轭。(e)⇒(f):$\mathcal M(S^*)$ 的列规范正交,由 7.49 $S^*$ 是等距。(f)⇒(a):对 $S^*$ 用已证的 (a)⇒(f),得 $(S^*)^*=S$ 是酉的。

与 7.49 相比,限定为算子后多出的信息是:$S^*S=I$ 并且 $SS^*=I$;规范正交「组」变成规范正交「基」;「列」也可以换成「行」。

回到类比:单位圆 $\{z:|z|=1\}$ 由 $\bar zz=1$ 刻画,对应的正是 $S^*S=I$——酉算子就是算子世界里的单位圆。特征值也印证了这一点:

定理酉算子的特征值绝对值为 1eigenvalues of unitary operators have absolute value 17.54

设 $\lambda$ 是酉算子的特征值,则 $|\lambda|=1$。

证明思路

若 $Sv=\lambda v$,$v\ne0$,则 $|\lambda|\,\|v\|=\|\lambda v\|=\|Sv\|=\|v\|$。

定理复内积空间上酉算子的描述description of unitary operators on complex inner product spaces7.55

设 $\mathbf F=\mathbf C$,$S\in\mathcal L(V)$。则 $S$ 是酉算子 ⟺ $V$ 有一组由 $S$ 的特征向量构成的规范正交基,且对应的特征值的绝对值全是 1。

证明思路

⇒:由 7.53(b) $S$ 正规,复谱定理给出规范正交特征基,7.54 给出 $|\lambda_k|=1$。⇐:$\langle Se_j,Se_k\rangle=\lambda_j\bar\lambda_k\langle e_j,e_k\rangle$,所以 $Se_1,\dots,Se_n$ 仍是规范正交基,由 7.53(d) $S$ 是酉的。

换句话说,复空间上的酉算子就是:在某组互相垂直的方向上,每个坐标都乘一个单位复数 $e^{i\theta_k}$(纯旋转、不伸缩)。在 $\mathbf R^2$ 中,酉算子只有两种(补充说明):行列式为 1 的旋转(特征值 $e^{\pm i\theta}$)和行列式为 $-1$ 的反射(特征值 $\pm1$)。

等距 = 保长度:旋转、反射,以及落在单位圆上的特征值

拖动角度 $\theta$、勾选「再作一次反射」,或者用「拉伸 $s$」故意破坏等距($S=R_\theta\cdot\operatorname{diag}(s,\pm1)$)。左图:字母 F、单位圆与标准基在 $S$ 下的像(彩色),灰色是原来的样子;右图:$S$ 的特征值在复平面中的位置,紫色虚线是单位圆。

$s=1$ 时:单位圆被映成它自己,$Se_1,Se_2$ 仍然等长且垂直(矩阵的两列规范正交,$S^{\mathrm t}S=I$),字母 F 只是被转动或翻面;特征值始终在单位圆上——旋转时是一对共轭复数 $e^{\pm i\theta}$(实平面中没有特征方向),反射时是 $1$ 和 $-1$(镜面方向与它的垂直方向)。一旦 $s\ne1$,单位圆变成椭圆,$S^{\mathrm t}S\ne I$,特征值也离开了单位圆。

QR 分解 QR Factorization

下面从算子转向矩阵:$n\times n$ 矩阵对应 $\mathbf F^n$(取欧氏内积与标准基)上的算子。先把酉算子的概念搬到矩阵上。

定义酉矩阵unitary matrix7.56

$n\times n$ 矩阵称为酉矩阵,如果它的各列构成 $\mathbf F^n$ 中的规范正交组(从而是规范正交基)。

定理酉矩阵的刻画characterizations of unitary matrices7.57

设 $Q$ 是 $n\times n$ 矩阵。以下等价:(a) $Q$ 是酉矩阵;(b) $Q$ 的各行构成规范正交组;(c) 对每个 $v\in\mathbf F^n$,$\|Qv\|=\|v\|$;(d) $Q^*Q=QQ^*=I$。

证明思路

把 $Q$ 看成 $\mathbf F^n$ 上的算子(标准基是规范正交基),这就是 7.49 与 7.53 的矩阵翻译(原书留作习题 7D.17)。

直觉:QR 就是把 Gram–Schmidt「记账」 对 $A$ 的列 $v_1,\dots,v_n$ 做 Gram–Schmidt,得到规范正交的 $e_1,\dots,e_n$,并且每一步都有 $\operatorname{span}(v_1,\dots,v_k)=\operatorname{span}(e_1,\dots,e_k)$ 7.59。于是 $v_k$ 只需要用 $e_1,\dots,e_k$ 就能表示:$v_k=\langle v_k,e_1\rangle e_1+\cdots+\langle v_k,e_k\rangle e_k$。把这些系数排成矩阵 $R$(第 $k$ 列是 $v_k$ 的坐标),它自然是上三角的;把 $e_k$ 排成 $Q$ 的列,就得到 $A=QR$。
定理QR 分解QR factorization7.58

设 $A$ 是各列线性无关的方阵,则存在唯一的矩阵 $Q$、$R$,使 $Q$ 是酉矩阵,$R$ 是对角元全为正数的上三角矩阵,且

$$A=QR .$$(7.58)
证明思路

存在:对 $A$ 的列 $v_1,\dots,v_n$ 做 Gram–Schmidt(6.32)得 $e_1,\dots,e_n$,令 $R_{j,k}=\langle v_k,e_j\rangle$。$j\gt k$ 时 $e_j\perp\operatorname{span}(e_1,\dots,e_k)\ni v_k$,所以 $R$ 上三角;$QR$ 的第 $k$ 列是 $\langle v_k,e_1\rangle e_1+\cdots+\langle v_k,e_k\rangle e_k=v_k$(6.30(a))。Gram–Schmidt 中每个 $v_k$ 等于 $e_k$ 的正倍数加上 $e_1,\dots,e_{k-1}$ 的组合,所以 $R_{k,k}=\langle v_k,e_k\rangle\gt0$。

唯一:若另有 $A=\hat Q\hat R$,则 $\hat Q$ 的列 $q_1,\dots,q_n$ 满足 $\operatorname{span}(v_1,\dots,v_k)=\operatorname{span}(q_1,\dots,q_k)$ 且 $\langle v_k,q_k\rangle\gt0$,而满足这两条的规范正交组是唯一的(习题 6B.10),故 $q_k=e_k$,$\hat Q=Q$,进而 $\hat R=R$。

例一个 3×3 矩阵的 QR 分解QR factorization of a 3-by-3 matrix7.60

$A=\begin{pmatrix} 1 & 2 & 1 \\ 0 & 1 & -4 \\ 0 & 3 & 2\end{pmatrix}$,列为 $v_1=(1,0,0)$,$v_2=(2,1,3)$,$v_3=(1,-4,2)$。Gram–Schmidt 给出

$e_1=(1,0,0),\quad e_2=\big(0,\tfrac1{\sqrt{10}},\tfrac3{\sqrt{10}}\big),\quad e_3=\big(0,-\tfrac3{\sqrt{10}},\tfrac1{\sqrt{10}}\big).$

以 $e_1,e_2,e_3$ 为列得 $Q$;按 $R_{j,k}=\langle v_k,e_j\rangle$ 得 $R$:

$Q=\begin{pmatrix} 1 & 0 & 0 \\ 0 & \frac1{\sqrt{10}} & -\frac3{\sqrt{10}} \\ 0 & \frac3{\sqrt{10}} & \frac1{\sqrt{10}}\end{pmatrix},\qquad R=\begin{pmatrix} 1 & 2 & 1 \\ 0 & \sqrt{10} & \frac{\sqrt{10}}5 \\ 0 & 0 & \frac{7\sqrt{10}}5\end{pmatrix}.$

$R$ 确实是对角元为正的上三角矩阵,并且可以验证 $QR=A$。例如 $R$ 的第 2 列说:$v_2=2e_1+\sqrt{10}\,e_2$。

QR = Gram–Schmidt 的记账本;Cholesky 的 $R$ 与它是同一个

拖动蓝色 $v_1$ 和红色 $v_2$($A$ 的两列)。「步骤」滑块逐步展示 Gram–Schmidt:① $e_1=v_1/\|v_1\|$;② 从 $v_2$ 中减去它在 $e_1$ 上的分量(橙色是剩下的部分);③ 单位化得 $e_2$。「整体旋转」把两列一起转动。

$R$ 的三个数都有几何意义:$R_{11}=\|v_1\|$,$R_{12}=\langle v_2,e_1\rangle$ 是 $v_2$ 在 $e_1$ 方向的投影长度,$R_{22}$ 是 $v_2$ 到 $v_1$ 所在直线的距离——它们只取决于两列的长度与夹角。所以拖动「整体旋转」时 $Q$ 在变,$R$ 却纹丝不动;同样不变的还有 $B=A^{\mathrm t}A$(两列两两内积组成的 Gram 矩阵),而且总有 $B=R^{\mathrm t}R$——这正是下面 Cholesky 分解的证明思路。

用 QR 解方程。若 $A=QR$,方程 $Ax=b$ 等价于 $QRx=b$,两边左乘 $Q^*$ 得 $Rx=Q^*b$。$Q^*$ 只是共轭转置,算 $Q^*b$ 很容易;$R$ 是对角元为正的上三角矩阵,先解 $x_n$,再解 $x_{n-1}$……(回代)即可,不需要 Gauss 消元。QR 分解也是计算特征值的著名「QR 算法」的核心(原书不展开)。

Cholesky 分解 Cholesky Factorization

先用内积刻画「可逆的正算子」:

定理可逆正算子positive invertible operator7.61

自伴算子 $T\in\mathcal L(V)$ 是可逆的正算子 ⟺ 对每个非零 $v\in V$ 有 $\langle Tv,v\rangle\gt0$。

证明思路

⇒:$v\ne0$ 时 $Tv\ne0$(可逆),由 7.43 $\langle Tv,v\rangle\ne0$,又 $\ge0$,故 $\gt0$。⇐:$\langle Tv,v\rangle\gt0$ 说明 $Tv\ne0$,$T$ 是单射从而可逆;正性显然。

定义正定positive definite7.62

矩阵 $B\in\mathbf F^{n,n}$ 称为正定的,如果 $B^*=B$ 且对每个非零 $x\in\mathbf F^n$ 有 $\langle Bx,x\rangle\gt0$。(由 7.61,这正是「可逆正算子」的矩阵版本。)

上三角矩阵的共轭转置是下三角的。下面的分解把正定矩阵写成「下三角 × 它的共轭转置」,在数值线性代数中非常重要(例如用两次三角回代解 $Bx=b$)。

定理Cholesky 分解Cholesky factorization7.63

设 $B$ 是正定矩阵,则存在唯一的对角元全为正数的上三角矩阵 $R$,使

$$B=R^*R .$$(7.63)
证明思路

存在:由 7.38 (a)⟺(f),存在可逆方阵 $A$ 使 $B=A^*A$。作 QR 分解 $A=QR$,则 $B=A^*A=R^*Q^*QR=R^*R$。

唯一:设又有 $B=S^*S$($S$ 上三角、对角元为正)。$S$ 可逆(因为 $B$ 可逆),且 $(AS^{-1})^*(AS^{-1})=(S^*)^{-1}BS^{-1}=(S^*)^{-1}S^*SS^{-1}=I$,所以 $AS^{-1}$ 是酉矩阵,$A=(AS^{-1})S$ 是 $A$ 的一个 QR 分解。由 QR 分解的唯一性,$S=R$。

(第一步也可以取 $A=\sqrt B$;但对具体的 $B$,往往有更容易找到的 $A$。)

André-Louis Cholesky(1875–1918)发现了这个分解,它在他去世后的 1924 年才发表。结合上面的演示来理解:正定矩阵 $B$ 可以看成某组向量两两内积组成的 Gram 矩阵($B=A^*A$),它只记录「长度与夹角」;Cholesky 因子 $R$ 就是把这些向量用 Gram–Schmidt 得到的坐标写出来——同样只依赖长度与夹角。

设 $S$ 是有限维复内积空间上的酉算子。下列哪一条一定成立?

等距映射isometry保长度的线性映射:$\|Sv\|=\|v\|$;⟺ $S^*S=I$ ⟺ 保内积 ⟺ 矩阵各列规范正交。
酉算子unitary operator可逆的等距算子:$S^*S=SS^*=I$,$S^{-1}=S^*$;特征值都在单位圆上。
酉矩阵unitary matrix各列(等价地,各行)规范正交的方阵;实的酉矩阵即正交矩阵。
QR 分解QR factorization列线性无关的方阵 $A=QR$:$Q$ 酉,$R$ 上三角且对角元为正;就是对列做 Gram–Schmidt。
正定矩阵positive definite matrix$B^*=B$ 且对所有非零 $x$ 有 $\langle Bx,x\rangle\gt0$;即可逆正算子的矩阵。
Cholesky 分解Cholesky factorization正定矩阵 $B=R^*R$,$R$ 上三角、对角元为正且唯一;由 $B=A^*A$ 与 $A=QR$ 得到。
本节要点
  • 等距 ⟺ $S^*S=I$ ⟺ 保内积 ⟺ 把规范正交基送成规范正交组 ⟺ 矩阵各列规范正交。
  • 酉算子 = 算子世界的单位圆:$S^*S=SS^*=I$,特征值 $|\lambda|=1$;复空间上 = 各正交方向上乘单位复数。
  • QR:$A=QR$ 是 Gram–Schmidt 的矩阵形式,可用于回代解方程。
  • Cholesky:正定 $B=A^*A=R^*Q^*QR=R^*R$,$R$ 只依赖于长度与夹角。

7E 奇异值分解 Singular Value Decomposition

特征值只对「从 $V$ 到 $V$」的算子有意义,而且对不正规的算子描述得很不完整(剪切的特征值都是 1,却明显在拉伸)。这一节引入另一组数——奇异值,它对任何线性映射 $T:V\to W$ 都有定义,并导出本章最实用的结果:奇异值分解(SVD)——每个线性映射在适当的两组规范正交基下都是「对角」的。

奇异值 Singular Values

一切从算子 $T^*T$ 开始。它有一个关键恒等式:$\langle T^*Tv,v\rangle=\langle Tv,Tv\rangle=\|Tv\|^2$。

直觉:$T^*T$ 记录了 $T$ 对长度的全部影响 $T$ 可能把 $V$ 送到另一个空间 $W$,没法直接谈「特征向量」。但 $T^*T$ 住在 $V$ 上,而且 $\|Tv\|^2=\langle T^*Tv,v\rangle$——$T$ 把哪个方向拉长多少,全写在这个正算子里。对 $T^*T$ 用谱定理,就能找到 $V$ 中那几条互相垂直、被 $T$ 拉伸得「最干净」的方向。
定理$T^*T$ 的性质properties of $T^*T$7.64

设 $T\in\mathcal L(V,W)$,则

  • (a) $T^*T$ 是 $V$ 上的正算子;(b) $\operatorname{null}T^*T=\operatorname{null}T$;(c) $\operatorname{range}T^*T=\operatorname{range}T^*$;
  • (d) $\dim\operatorname{range}T=\dim\operatorname{range}T^*=\dim\operatorname{range}T^*T$。
证明思路

(a) $(T^*T)^*=T^*T$,且 $\langle T^*Tv,v\rangle=\|Tv\|^2\ge0$。(b) 若 $T^*Tv=0$,则 $\|Tv\|^2=\langle T^*Tv,v\rangle=0$;反向显然。(c) $\operatorname{range}T^*T=(\operatorname{null}T^*T)^\perp=(\operatorname{null}T)^\perp=\operatorname{range}T^*$(7.6)。(d) $\dim\operatorname{range}T=\dim(\operatorname{null}T^*)^\perp=\dim W-\dim\operatorname{null}T^*=\dim\operatorname{range}T^*$,再用 (c)。

定义奇异值singular values7.65

设 $T\in\mathcal L(V,W)$。$T$ 的奇异值是 $T^*T$ 的各特征值的非负平方根,按降序排列,每个重复的次数等于 $T^*T$ 对应特征空间的维数。

所以奇异值一共恰好有 $\dim V$ 个($T^*T$ 可以被规范正交特征基对角化),记作 $s_1\ge s_2\ge\cdots\ge s_n\ge0$。

例$\mathbf F^4$ 上一个算子的奇异值7.66

$T(z_1,z_2,z_3,z_4)=(0,3z_1,2z_2,-3z_4)$。计算得 $T^*T(z_1,z_2,z_3,z_4)=(9z_1,4z_2,0,9z_4)$:标准基就把 $T^*T$ 对角化,特征值 9、4、0,对应特征空间维数 2、1、1。所以 $T$ 的奇异值是 $3,3,2,0$。

而 $T$ 的特征值只有 $-3$ 和 $0$——特征值漏掉了 $T$ 定义里明明出现的「2 倍」,奇异值却抓住了它。

例从 $\mathbf F^4$ 到 $\mathbf F^3$ 的线性映射的奇异值7.67

设 $\mathcal M(T)=\begin{pmatrix} 0 & 0 & 0 & -5 \\ 0 & 0 & 0 & 0 \\ 1 & 1 & 0 & 0\end{pmatrix}$。则 $\mathcal M(T^*T)=\begin{pmatrix} 1 & 1 & 0 & 0 \\ 1 & 1 & 0 & 0 \\ 0 & 0 & 0 & 0 \\ 0 & 0 & 0 & 25\end{pmatrix}$,特征值 25、2、0(维数 1、1、2),所以奇异值是 $5,\sqrt2,0,0$。

定理正奇异值的作用role of positive singular values7.68

设 $T\in\mathcal L(V,W)$,则 (a) $T$ 是单射 ⟺ 0 不是 $T$ 的奇异值;(b) $T$ 的正奇异值的个数 $=\dim\operatorname{range}T$;(c) $T$ 是满射 ⟺ 正奇异值的个数 $=\dim W$。

证明思路

(a) $\operatorname{null}T=\{0\}\iff\operatorname{null}T^*T=\{0\}$(7.64(b))⟺ 0 不是 $T^*T$ 的特征值。(b) 由谱定理,$\dim\operatorname{range}T^*T$ = $T^*T$ 正特征值的个数(计重数),再用 7.64(d)。(c) 由 (b) 与 2.39。

特征值的列表奇异值的列表
背景:向量空间背景:内积空间
只对从一个空间到它自身的算子有定义对从一个内积空间到(可能不同的)另一个内积空间的线性映射都有定义
可以是任意实数($\mathbf F=\mathbf R$)或复数($\mathbf F=\mathbf C$)都是非负数
$\mathbf F=\mathbf R$ 时可以是空列表列表长度等于定义域的维数
含 0 ⟺ 算子不可逆含 0 ⟺ 线性映射不是单射
没有标准的顺序(尤其 $\mathbf F=\mathbf C$ 时)总是按降序排列
定理等距 ⟺ 所有奇异值都是 1isometries characterized by having all singular values equal 17.69

设 $S\in\mathcal L(V,W)$,则 $S$ 是等距映射 ⟺ $S$ 的所有奇异值都等于 1。

证明思路

$S$ 等距 ⟺ $S^*S=I$(7.49)⟺ 正算子 $S^*S$ 的所有特征值都是 1(谱定理)⟺ 所有奇异值都是 1。

$T\in\mathcal L(\mathbf C^2)$ 的矩阵是 $\begin{pmatrix} 0 & 5 \\ 0 & 0\end{pmatrix}$。它的特征值与奇异值分别是?

线性映射与矩阵的 SVD SVD for Linear Maps and for Matrices

定理奇异值分解singular value decomposition7.70

设 $T\in\mathcal L(V,W)$,$T$ 的正奇异值为 $s_1,\dots,s_m$。则存在 $V$ 中的规范正交组 $e_1,\dots,e_m$ 与 $W$ 中的规范正交组 $f_1,\dots,f_m$,使得对每个 $v\in V$,

$$Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m .$$(7.71)
怎么读这个公式 对每个 $k$:先量 $v$ 在 $e_k$ 方向上的分量 $\langle v,e_k\rangle$,乘以 $s_k$,再放到 $f_k$ 方向上。也就是说,$T$ 把互相垂直的方向 $e_1,\dots,e_m$ 分别送到互相垂直的方向 $f_1,\dots,f_m$,并在第 $k$ 个方向上拉伸 $s_k$ 倍;与 $e_1,\dots,e_m$ 都垂直的部分被压成 0。几何上:单位球被变成半轴为 $s_1f_1,\dots,s_mf_m$ 的椭球(7F 会严格证明)。与 7B 开头谱定理的公式 $Tv=\sum\lambda_k\langle v,e_k\rangle e_k$ 对比:SVD 允许「进」与「出」用两组不同的规范正交基。

证明很短,而且是构造性的——它直接告诉你怎么算。用步骤播放器走一遍(图中 $T$ 是 $\mathbf R^2$ 上一个固定的算子,奇异值 $s_1=2$、$s_2=0.8$):

第 1 步:对 $T^*T$ 用谱定理

$T^*T$ 是正算子(7.64(a)),谱定理给出 $V$ 的规范正交基 $e_1,\dots,e_n$,满足 $T^*Te_k=s_k^2e_k$ 7.72,其中 $s_1,\dots,s_n$ 是全部奇异值(前 $m$ 个为正)。左图:单位圆与 $e_1,e_2$。

第 2 步:$Te_1,Te_2$ 仍然互相垂直,长度是 $s_k$

关键计算:$\langle Te_j,Te_k\rangle=\langle e_j,T^*Te_k\rangle=s_k^2\langle e_j,e_k\rangle$。$j\ne k$ 时为 0(垂直),$j=k$ 时为 $s_k^2$(长度 $s_k$)。$k\gt m$ 时 $s_k=0$,于是 $Te_k=0$(7.64(b))。

第 3 步:单位化得到 $f_k$

对 $k=1,\dots,m$ 令 $f_k=\dfrac{Te_k}{s_k}$ 7.73。由上一步,$f_1,\dots,f_m$ 是 $W$ 中的规范正交组。

第 4 步:把任意 $v$ 分解

$v=\langle v,e_1\rangle e_1+\cdots+\langle v,e_n\rangle e_n$,所以 $Tv=\langle v,e_1\rangle Te_1+\cdots+\langle v,e_m\rangle Te_m=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$($k\gt m$ 的项都是 0)。这就是 7.71。右图的椭圆是单位圆的像。

把 $e_1,\dots,e_m$ 扩充成 $V$ 的规范正交基、$f_1,\dots,f_m$ 扩充成 $W$ 的规范正交基,则 $Te_k=s_kf_k$($k\le m$),$Te_k=0$($k\gt m$)。于是 $T$ 关于这两组基的矩阵除了 $(k,k)$ 位置上的 $s_k$ 之外全是 0。把「对角矩阵」的定义推广到非方阵:

定义对角矩阵diagonal matrix7.74

$M\times N$ 矩阵 $A$ 称为对角矩阵,如果除了 $A_{k,k}$($k=1,\dots,\min\{M,N\}$)之外,其余元素全为 0。

于是得到一个美妙的结论:从 $V$ 到 $W$ 的每个线性映射,关于适当的两组规范正交基,都有对角矩阵。

谱定理(7.29、7.31)奇异值分解(7.70)
只描述自伴算子($\mathbf F=\mathbf R$)或正规算子($\mathbf F=\mathbf C$)描述从一个内积空间到(可能不同的)另一个内积空间的任意线性映射
给出一组规范正交基给出两组规范正交组(定义域一组、到达空间一组),即使两个空间相同,它们也不一定相同
$\mathbf F=\mathbf R$ 与 $\mathbf F=\mathbf C$ 的证明不同同一个证明对 $\mathbf R$、$\mathbf C$ 都适用

下面把 SVD 放到 2×2 矩阵上动起来看。矩阵形式(7.80)写作 $A=BDC^*$:$C$ 的列是 $e_k$,$D=\operatorname{diag}(s_1,s_2)$,$B$ 的列是 $f_k$。读的顺序从右往左:$C^*$ 先把 $e_1,e_2$ 转到坐标轴上,$D$ 沿坐标轴拉伸,$B$ 再把坐标轴转到 $f_1,f_2$。

SVD 三步走:转($C^*$)→ 沿坐标轴拉伸($D$)→ 再转($B$)

点「播放」或拖动进度条,看矩阵 $A=BDC^*$ 怎样分三步把单位圆(连同字母 F)变成椭圆。蓝、红两条直径是 $e_1,e_2$($C$ 的列,也叫右奇异向量)。拖动空心圆点 $Ae_1$、$Ae_2$(即矩阵的两列)可以换一个矩阵,也可以从下拉框挑一个。

第 ① 步只是转动(圆还是圆,F 没有变形);第 ② 步沿水平、竖直方向分别拉伸 $s_1$、$s_2$ 倍,圆变成「摆正」的椭圆;第 ③ 步再转动,椭圆的长轴落到 $f_1$ 上,长度 $s_1$,短半轴 $s_2$。任何矩阵都是这样:剪切看似「斜着推」,其实也只是转–拉–转。「对称」矩阵的两次旋转互为逆($B=C$,符号可能差一个负号);「det < 0」的矩阵需要一次反射,动画里表现为第 ② 步把图形压扁再翻面;「秩 1」的 $s_2=0$,椭圆压成线段;「旋转 × 伸缩」的 $s_1=s_2$,圆仍是圆。

SVD 还给了伴随与伪逆一个新的看法:伴随 = 把 $e$ 与 $f$ 的角色互换;伪逆 = 互换角色,并把每个 $s_k$ 换成 $1/s_k$。

定理伴随与伪逆的奇异值分解singular value decomposition of adjoint and pseudoinverse7.75

设 $T\in\mathcal L(V,W)$ 的正奇异值为 $s_1,\dots,s_m$,规范正交组 $e_1,\dots,e_m$、$f_1,\dots,f_m$ 使 $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$ 7.76。则对每个 $w\in W$:

$T^*w=s_1\langle w,f_1\rangle e_1+\cdots+s_m\langle w,f_m\rangle e_m$ 7.77

$$T^\dagger w=\frac{\langle w,f_1\rangle}{s_1}\,e_1+\cdots+\frac{\langle w,f_m\rangle}{s_m}\,e_m .$$(7.78)
证明思路

7.77:直接展开 $\langle Tv,w\rangle=\sum s_k\langle v,e_k\rangle\langle f_k,w\rangle=\big\langle v,\sum s_k\langle w,f_k\rangle e_k\big\rangle$。7.78:记右边为 $v$,则 $Tv=\sum\langle w,f_k\rangle f_k=P_{\operatorname{range}T}w$($f_1,\dots,f_m$ 是 $\operatorname{range}T$ 的规范正交基),且 $v\in(\operatorname{null}T)^\perp$(习题 7E.8(b));由伪逆的定义(6.68),$v=T^\dagger w$。

回忆 $T$ 可逆时 $T^\dagger=T^{-1}$(6.69(a)):7.78 就是「逆映射把 $f_k$ 送回 $e_k$、并缩小 $s_k$ 倍」。伪逆对 $\operatorname{range}T$ 以外的部分(与所有 $f_k$ 垂直的分量)直接置零——这正是最小二乘意义下的「最好的逆」。

例求一个奇异值分解finding a singular value decomposition7.79

$T(x_1,x_2,x_3,x_4)=(-5x_4,\ 0,\ x_1+x_2)$,即例 7.67 的矩阵。$T^*T$ 的正特征值是 25 与 2,所以正奇异值是 $5,\sqrt2$。$E(25,T^*T)$ 的规范正交基是 $(0,0,0,1)$,$E(2,T^*T)$ 的规范正交基是 $(\tfrac1{\sqrt2},\tfrac1{\sqrt2},0,0)$。按证明的做法取

$e_1=(0,0,0,1),\quad e_2=\big(\tfrac1{\sqrt2},\tfrac1{\sqrt2},0,0\big),\quad f_1=\dfrac{Te_1}{5}=(-1,0,0),\quad f_2=\dfrac{Te_2}{\sqrt2}=(0,0,1),$

则 $Tv=5\langle v,e_1\rangle f_1+\sqrt2\langle v,e_2\rangle f_2$ 对所有 $v\in\mathbf F^4$ 成立。验算:$\langle v,e_1\rangle=x_4$ 给出 $(-5x_4,0,0)$;$\langle v,e_2\rangle=\frac{x_1+x_2}{\sqrt2}$ 给出 $(0,0,x_1+x_2)$。

最后把 SVD 翻译成矩阵语言:任意矩阵都能写成三个「好」矩阵的乘积。(下面「规范正交的列」指关于欧氏内积。)

定理矩阵版 SVDmatrix version of SVD7.80

设 $A$ 是秩为 $m\ge1$ 的 $p\times n$ 矩阵。则存在列规范正交的 $p\times m$ 矩阵 $B$、对角元为正数的 $m\times m$ 对角矩阵 $D$、列规范正交的 $n\times m$ 矩阵 $C$,使

$$A=BDC^* .$$(7.80)
证明思路

设 $T:\mathbf F^n\to\mathbf F^p$ 的矩阵是 $A$,$Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$ 7.81 是它的 SVD($m=\dim\operatorname{range}T$)。令 $B$ 的列为 $f_1,\dots,f_m$,$D=\operatorname{diag}(s_1,\dots,s_m)$,$C$ 的列为 $e_1,\dots,e_m$。对 $\mathbf F^m$ 的标准基 $u_k$,$(AC-BD)u_k=Ae_k-s_kf_k=0$,所以 $AC=BD$,从而 $ACC^*=BDC^*$。而 $ACC^*$ 与 $A$ 在 $\operatorname{span}(e_1,\dots,e_m)$ 上一致($CC^*e_k=e_k$),在其正交补上都为 0,所以 $ACC^*=A$。

省空间。$A$ 有 $pn$ 个元素,而 $B,D,C$ 一共有 $m(p+m+n)$ 个元素。当 $p,n$ 很大而秩 $m$ 小得多时,存 $B,D,C$ 远比存 $A$ 省。下一节会看到:即使 $A$ 的秩不小,只保留最大的几个奇异值也能得到最好的近似——这就是图像压缩的原理。

补充:SVD 在应用中 SVD 大概是应用最广的矩阵分解(以下超出原书范围,仅帮你建立联系):主成分分析(PCA)——对中心化后的数据矩阵做 SVD,右奇异向量 $e_1,e_2,\dots$ 就是数据变化最大的方向,奇异值衡量各方向的「分量」;最小二乘——7.78 的伪逆 $T^\dagger$ 直接给出最小二乘解;数值秩与条件数——很小的奇异值说明矩阵「几乎」不满秩,$s_1/s_n$ 越大,解方程越不稳定;压缩与去噪——下一节的最佳低秩逼近。
奇异值singular values$T^*T$ 的特征值的非负平方根,降序排列、按特征空间维数重复;共 $\dim V$ 个。
奇异值分解singular value decomposition (SVD)$Tv=\sum_k s_k\langle v,e_k\rangle f_k$,$e_k$、$f_k$ 分别是 $V$、$W$ 中的规范正交组;矩阵形式 $A=BDC^*$。
对角矩阵(非方阵)diagonal matrix (7.74)除 $A_{k,k}$($k\le\min\{M,N\}$)外全为 0 的 $M\times N$ 矩阵;每个线性映射在适当的两组规范正交基下都是对角的。
Schmidt 对Schmidt pair非零向量 $v,w$ 满足 $Tv=sw$ 且 $T^*w=sv$($s\gt0$);$s$ 是奇异值 ⟺ 存在这样一对(习题 7E.2)。
本节要点
  • 奇异值 = $\sqrt{T^*T\text{ 的特征值}}$;对任意 $T:V\to W$ 都有定义,都是非负数,共 $\dim V$ 个。
  • 正奇异值个数 = $\dim\operatorname{range}T$;等距 ⟺ 奇异值全为 1。
  • SVD:$Tv=\sum s_k\langle v,e_k\rangle f_k$——转、拉、转;$T^*$ 与 $T^\dagger$ 只需互换 $e,f$(伪逆再把 $s_k$ 换成 $1/s_k$)。
  • 矩阵形式 $A=BDC^*$;Erhard Schmidt 在 1907 年引入了奇异值。

7F 奇异值分解的推论 Consequences of Singular Value Decomposition

SVD 把任何线性映射拆成「转–拉–转」。这一节收获它的回报:线性映射有多「大」(范数 = 最大拉伸倍数)、怎样用低秩映射最好地逼近它、任何算子都能写成「酉 × 正」(极分解)、算子把球和盒子变成什么(椭球与平行多面体)、以及体积为什么按奇异值之积缩放。最后用一张表收束整章:正规算子的性质完全由特征值的位置决定。

线性映射的范数 Norms of Linear Maps

定理$\|Tv\|$ 的上界upper bound for $\|Tv\|$7.82

设 $T\in\mathcal L(V,W)$,$s_1$ 是 $T$ 的最大奇异值,则对所有 $v\in V$ 有 $\|Tv\|\le s_1\|v\|$。

证明思路

由 SVD $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$ 7.83,$f_k$ 规范正交,所以

$\|Tv\|^2=s_1^2|\langle v,e_1\rangle|^2+\cdots+s_m^2|\langle v,e_m\rangle|^2\le s_1^2\big(|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_m\rangle|^2\big)\le s_1^2\|v\|^2$,

最后一步是 Bessel 不等式(6.26)。(下界见习题 7E.14:$\|Tv\|\ge s_n\|v\|$。)

于是 $\|v\|\le1$ 时 $\|Tv\|\le s_1$ 7.84;而取 $v=e_1$ 恰好 $\|Te_1\|=\|s_1f_1\|=s_1$。所以

$\max\{\|Tv\|:v\in V,\ \|v\|\le1\}=s_1$ 7.85。

这就启发了下面的定义——它完全不提奇异值:

定义线性映射的范数norm of a linear map, $\|\cdot\|$7.86

设 $T\in\mathcal L(V,W)$,$T$ 的范数定义为

$$\|T\|=\max\{\|Tv\|:v\in V\text{ 且 }\|v\|\le1\}.$$

一般来说,无穷多个非负数的集合不一定有最大值;但上面的讨论说明这里的最大值存在,而且等于 $s_1$。注意现在「$\|\cdot\|$」有两个意思:向量的范数(来自内积)与线性映射的范数。后者一般不来自 $\mathcal L(V,W)$ 上的某个内积(习题 7F.21),看上下文与符号就能分清。

定理线性映射范数的基本性质basic properties of norms of linear maps7.87

设 $T\in\mathcal L(V,W)$,则 (a) $\|T\|\ge0$;(b) $\|T\|=0\iff T=0$;(c) $\|\lambda T\|=|\lambda|\,\|T\|$;(d) $\|S+T\|\le\|S\|+\|T\|$(三角不等式)。

证明思路

(b) 若 $\|T\|=0$,则对 $u\ne0$,$Tu=\|u\|\,T(u/\|u\|)=0$。(c) 把 $|\lambda|$ 提到最大值外面。(d) 取 $\|v\|\le1$ 使 $\|S+T\|=\|(S+T)v\|$,则 $\|(S+T)v\|\le\|Sv\|+\|Tv\|\le\|S\|+\|T\|$。

这些性质与向量范数的性质(6.9、6.17)一模一样。$\|S-T\|$ 常被称为 $S$ 与 $T$ 的距离:它小,就表示两个映射「很接近」。

定理$\|T\|$ 的其他公式alternative formulas for $\|T\|$7.88

设 $T\in\mathcal L(V,W)$,则

  • (a) $\|T\|$ = $T$ 的最大奇异值 $s_1$;
  • (b) $\|T\|=\max\{\|Tv\|:\|v\|=1\}$(只看单位球面就够);
  • (c) $\|T\|$ 是使「$\|Tv\|\le c\|v\|$ 对所有 $v$ 成立」的最小的 $c$。特别地,$\|Tv\|\le\|T\|\,\|v\|$ 7.89——这是最常用的不等式。

实际计算时 (a) 最有用:先算 $T^*T$ 的矩阵,让计算机近似它的最大特征值,再开方。(范数一般没有精确公式。)

例范数norms7.90
  • $\|I\|=1$。
  • 若 $T\in\mathcal L(\mathbf F^n)$ 的矩阵全是 1,则 $\|T\|=n$(它把 $(1,\dots,1)/\sqrt n$ 拉长 $n$ 倍)。
  • 若 $V$ 有由 $T$ 的特征向量构成的规范正交基,特征值为 $\lambda_1,\dots,\lambda_n$,则 $\|T\|=\max\{|\lambda_1|,\dots,|\lambda_n|\}$。
  • $5\times5$ 矩阵 $\big(\frac{1}{j^2+k}\big)_{j,k}$:软件算得最大奇异值约 0.8、最小约 $10^{-6}$,所以 $\|T\|\approx0.8$,$\|T^{-1}\|\approx10^6$(用习题 7E.10:$T^{-1}$ 的奇异值是 $1/s_k$)。
定理伴随的范数norm of the adjoint7.91

设 $T\in\mathcal L(V,W)$,则 $\|T^*\|=\|T\|$。

证明思路

$\|T^*w\|^2=\langle TT^*w,w\rangle\le\|TT^*w\|\,\|w\|\le\|T\|\,\|T^*w\|\,\|w\|$,约去得 $\|T^*w\|\le\|T\|\,\|w\|$,由 7.88(c) 得 $\|T^*\|\le\|T\|$;再对 $T^*$ 用一次得反向不等式。(也可以用习题 7E.9:$T$ 与 $T^*$ 的正奇异值相同。)

算子范数 = 单位圆上的最大拉伸倍数 $s_1$

选一个矩阵,沿单位圆拖动绿色的 $v$。左图:蓝色椭圆是单位圆的像,紫色虚线圆的半径是 $\|T\|=s_1$,空心点标出被拉得最长的方向 $e_1$ 与它的像 $Te_1=s_1f_1$。右图:$v$ 转半圈时 $\|Tv\|$ 的变化,以及 $s_1$、$s_2$、$\max|\lambda|$ 三条参考线。

$\|Tv\|$ 在 $s_2$ 与 $s_1$ 之间来回摆动,最大值 $s_1=\|T\|$ 恰在 $v=\pm e_1$ 时取到,最小值 $s_2$ 在与它垂直的方向取到(习题 7E.4:$\{\|Tv\|:\|v\|=1\}=[s_n,s_1]$)。对称、旋转×伸缩、全 1 矩阵这些正规矩阵,$\|T\|$ 等于最大的 $|\lambda|$(例 7.90、习题 7F.2);但剪切的两个特征值都是 1,范数却是 $\frac{1+\sqrt5}{2}\approx1.618$,幂零矩阵的特征值全为 0,范数却是 1.5——对不正规的算子,特征值会严重低估它的「大小」。

用低维值域的线性映射做逼近 Approximation by Linear Maps with Lower-Dimensional Range

SVD 的一个「惊人」应用(Axler 语):要用值域不超过 $k$ 维的线性映射去最好地逼近 $T$,只需把 SVD 砍到前 $k$ 项。这就是压缩巨大矩阵、同时保留最重要信息的算法基础。

定理值域维数 ≤ $k$ 的最佳逼近best approximation by linear map whose range has dimension ≤ $k$7.92

设 $T\in\mathcal L(V,W)$ 的正奇异值为 $s_1\ge\cdots\ge s_m$,$1\le k\lt m$。则

$$\min\{\|T-S\|:\ S\in\mathcal L(V,W),\ \dim\operatorname{range}S\le k\}=s_{k+1}.$$

而且若 $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$ 是 $T$ 的 SVD,令 $T_kv=s_1\langle v,e_1\rangle f_1+\cdots+s_k\langle v,e_k\rangle f_k$,则 $\dim\operatorname{range}T_k=k$ 且 $\|T-T_k\|=s_{k+1}$——最小值由截断的 SVD 取到。

证明思路

$T_k$ 的误差恰为 $s_{k+1}$:$\|(T-T_k)v\|^2=s_{k+1}^2|\langle v,e_{k+1}\rangle|^2+\cdots+s_m^2|\langle v,e_m\rangle|^2\le s_{k+1}^2\|v\|^2$,且 $v=e_{k+1}$ 时取等号。

谁也做不得更好:若 $\dim\operatorname{range}S\le k$,则 $k+1$ 个向量 $Se_1,\dots,Se_{k+1}$ 线性相关,存在不全为 0 的 $a_j$ 使 $S(a_1e_1+\cdots+a_{k+1}e_{k+1})=0$。对 $u=a_1e_1+\cdots+a_{k+1}e_{k+1}\ne0$:

$\|(T-S)u\|^2=\|Tu\|^2=s_1^2|a_1|^2+\cdots+s_{k+1}^2|a_{k+1}|^2\ge s_{k+1}^2\|u\|^2$,

所以 $\|T-S\|\ge s_{k+1}$。直观地说:$k$ 维的值域「管不过来」$k+1$ 个拉伸方向,总有一个被拉伸至少 $s_{k+1}$ 倍的方向被它完全漏掉。

最佳低秩逼近:只保留前 $k$ 个奇异值(图像压缩)

把一幅 48×48 的灰度「图像」看成 48×48 矩阵 $A$(每个像素的深浅是一个元素)。右图是截断 SVD $A_k$:只保留最大的 $k$ 个奇异值和对应的 $e_j,f_j$。拖动滑块改变 $k$。下方是全部奇异值(对数刻度):蓝色是保留的,红色的 $s_{k+1}$ 正是误差 $\|A-A_k\|$。

原图 A

秩 k 逼近

$k=1$ 时图像只剩「行 × 列」的网格状明暗(秩 1 矩阵 $s_1f_1e_1^{\mathrm t}$ 的每一行都成比例);$k$ 到 5 左右房子、太阳已经可辨;到 15 左右几乎看不出差别——而只需存储 $k(48+48+1)$ 个数。读数里用幂迭代独立算出的 $\|A-A_k\|$ 总是等于 $s_{k+1}$,这就是 7.92。奇异值衰减得越快,图像越「好压缩」。

另见习题 7F.22(找一个 $k$ 维子空间,使 $T$ 在其上的限制最小)与习题 7F.27(离 $T$ 最近的酉算子)。

极分解 Polar Decomposition

回到类比表的最后一行。每个非零复数都能写成

$z=\Big(\dfrac{z}{|z|}\Big)|z|=\Big(\dfrac{z}{|z|}\Big)\sqrt{\bar zz}$,其中第一个因子的绝对值为 1。

类比猜想:每个算子 $T\in\mathcal L(V)$ 都能写成「酉算子 × $\sqrt{T^*T}$」。$T^*T$ 是正算子(7.64(a)),所以 $\sqrt{T^*T}$ 有意义。猜想是对的:

定理极分解polar decomposition7.93

设 $T\in\mathcal L(V)$,则存在酉算子 $S\in\mathcal L(V)$,使

$$T=S\sqrt{T^*T} .$$(7.93)
证明思路

取 SVD $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m$ 7.94,并把 $e_k$、$f_k$ 各扩充成 $V$ 的规范正交基 $e_1,\dots,e_n$ 与 $f_1,\dots,f_n$。定义 $Sv=\langle v,e_1\rangle f_1+\cdots+\langle v,e_n\rangle f_n$——它把一组规范正交基送到另一组,保长度,是酉算子。由 7.77,$T^*Tv=\sum s_k^2\langle v,e_k\rangle e_k$,所以 $\sqrt{T^*T}\,v=\sum s_k\langle v,e_k\rangle e_k$(右边是平方等于 $T^*T$ 的正算子)。于是 $S\sqrt{T^*T}\,v=\sum s_k\langle v,e_k\rangle f_k=Tv$。

直觉:极分解 = 把 SVD 的三步重新分组 SVD 是「转($C^*$)–拉($D$)–转($B$)」。在拉伸之后先「转回去」再「转过来」:$A=BDC^*=(BC^*)(CDC^*)$。其中 $CDC^*=\sqrt{A^*A}$ 是沿 $e_1,\dots,e_n$ 这几条互相垂直的方向纯拉伸(正算子),$BC^*=S$ 是纯旋转/反射(酉算子)。一个管「形状」,一个管「朝向」。
极分解 $T=S\sqrt{T^*T}$:先「纯拉伸」,再「纯旋转」

点「播放」或拖动进度条。第 ① 步是正算子 $\sqrt{T^*T}$:只沿两条互相垂直的紫色虚线拉伸,这两条线在拉伸过程中一动不动;第 ② 步是酉算子 $S$:只转动(det < 0 时还带一次反射),形状不再改变。拖动空心圆点 $Te_1,Te_2$ 可以换一个 $T$。

第 ① 步结束时,椭圆已经是最终的形状,只是朝向不对;第 ② 步把它整体转到位。选「正算子」:$T$ 本身就是 $\sqrt{T^*T}$,$S=I$,第 ② 步什么也不做(类比:正数 $z=1\cdot|z|$)。选「正规」:$\sqrt{T^*T}$ 是数乘,第 ① 步把圆均匀放大,$S$ 是纯旋转——两者可以同时对角化(习题 7F.31),就像 $z=e^{i\theta}\cdot r$。

关于 $\mathbf F=\mathbf C$ 的补充:$S$ 可以被某组规范正交基对角化(7.55),$\sqrt{T^*T}$ 也可以被某组规范正交基对角化(谱定理),但这两组基一般不同。它们能取同一组 ⟺ $T$ 正规(习题 7F.31 及原书的讨论)。此外,$T$ 可逆 ⟺ $S$ 唯一(习题 7F.26);若 $T=SR$,$S$ 酉、$R$ 正,则必有 $R=\sqrt{T^*T}$(习题 7F.30);证明中构造的 $S$ 是所有酉算子里离 $T$ 最近的(习题 7F.27)。极分解对实、复内积空间上的所有算子都成立。

算子作用于椭球与平行多面体 Operators Applied to Ellipsoids and Parallelepipeds

定义球 $B$ball, $B$7.95

$V$ 中以 0 为中心、半径为 1 的球是 $B=\{v\in V:\|v\|\lt1\}$。($\dim V=2$ 时也叫圆盘;为统一起见,任何维数都叫球。)

把球沿 $f_k$ 轴拉伸 $s_k$ 倍,就得到椭球:

定义椭球 $E(s_1f_1,\dots,s_nf_n)$、主轴ellipsoid, principal axes7.96

设 $f_1,\dots,f_n$ 是 $V$ 的规范正交基,$s_1,\dots,s_n$ 是正数。以 $s_1f_1,\dots,s_nf_n$ 为主轴的椭球定义为

$$E(s_1f_1,\dots,s_nf_n)=\Big\{v\in V:\ \frac{|\langle v,f_1\rangle|^2}{s_1^2}+\cdots+\frac{|\langle v,f_n\rangle|^2}{s_n^2}\lt1\Big\}.$$
−2 2 −1 1 E(2f₁, f₂),f₁, f₂ = 标准基 −√2 √2 −√2 √2 2f₁ f₂ E(2f₁, f₂),f₁ = (1,1)/√2,f₂ = (−1,1)/√2
对应原书例 7.97:同样是 $E(2f_1,f_2)$,主轴方向由规范正交基 $f_1,f_2$ 决定。由 Parseval 恒等式,$E(f_1,\dots,f_n)$ 就是球 $B$(对任意规范正交基)。(原书还画了 $\mathbf R^3$ 中的椭球 $E(4f_1,3f_2,2f_3)$。)
定义记号 $T(\Omega)$notation: $T(\Omega)$7.98

对定义在 $V$ 上的函数 $T$ 与 $\Omega\subseteq V$,记 $T(\Omega)=\{Tv:v\in\Omega\}$。例如 $T(V)=\operatorname{range}T$。

定理可逆算子把球映成椭球invertible operator takes ball to ellipsoid7.99

设 $T\in\mathcal L(V)$ 可逆,则 $T$ 把 $V$ 中的球 $B$ 映成一个椭球。具体地,若 $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_n\langle v,e_n\rangle f_n$ 是 SVD 7.100,则 $T(B)=E(s_1f_1,\dots,s_nf_n)$——椭球的主轴来自 SVD。

证明思路

可逆 ⇒ 奇异值都非零(7.68)。若 $v\in B$,则 $\sum_k|\langle Tv,f_k\rangle|^2/s_k^2=\sum_k|\langle v,e_k\rangle|^2=\|v\|^2\lt1$,所以 $T(B)\subseteq E$。反过来,对 $w\in E$ 令 $v=\sum_k\frac{\langle w,f_k\rangle}{s_k}e_k$,则 $\|v\|\lt1$ 且 $Tv=w$。

定理可逆算子把椭球映成椭球invertible operator takes ellipsoids to ellipsoids7.101

设 $T\in\mathcal L(V)$ 可逆,$E$ 是 $V$ 中的椭球,则 $T(E)$ 也是椭球。

证明思路

设 $E=E(s_1f_1,\dots,s_nf_n)$,令 $S(a_1f_1+\cdots+a_nf_n)=a_1s_1f_1+\cdots+a_ns_nf_n$,则 $S(B)=E$,于是 $T(E)=T(S(B))=(TS)(B)$,对可逆算子 $TS$ 用 7.99。

回忆 $u+\Omega=\{u+w:w\in\Omega\}$(3.95):形状与 $\Omega$ 相同,只是换了位置。

定义$P(v_1,\dots,v_n)$、平行多面体parallelepiped7.102

设 $v_1,\dots,v_n$ 是 $V$ 的基,令 $P(v_1,\dots,v_n)=\{a_1v_1+\cdots+a_nv_n:\ a_1,\dots,a_n\in(0,1)\}$。形如 $u+P(v_1,\dots,v_n)$ 的集合称为平行多面体,$v_1,\dots,v_n$ 称为它的棱(edges)。($\dim V=2$ 时就是平行四边形。)

定理可逆算子把平行多面体映成平行多面体invertible operator takes parallelepipeds to parallelepipeds7.104

设 $u\in V$,$v_1,\dots,v_n$ 是 $V$ 的基,$T\in\mathcal L(V)$ 可逆,则 $T\big(u+P(v_1,\dots,v_n)\big)=Tu+P(Tv_1,\dots,Tv_n)$。(线性性直接给出:$T(u+\sum a_kv_k)=Tu+\sum a_kTv_k$。)

就像长方形是平行四边形中的特殊成员,棱互相垂直的平行多面体也有专名:

定义盒子box7.105

$V$ 中的盒子是形如 $u+P(r_1e_1,\dots,r_ne_n)$ 的集合,其中 $u\in V$,$r_1,\dots,r_n$ 为正数,$e_1,\dots,e_n$ 是 $V$ 的规范正交基。($\mathbf R^2$ 中的盒子就是长方形。)

v₁ v₂ u 0.3 1.3 2.3 0.5 1.5 平行多面体 (0.3, 0.5) + P((1,0), (1,1)) √2 e₁ √2 e₂ 1 2 1 2 盒子 (1, 0) + P(√2 e₁, √2 e₂)
左:原书例 7.103 的平行多面体 $(0.3,0.5)+P((1,0),(1,1))$;右:原书例 7.106 的盒子 $(1,0)+P(\sqrt2e_1,\sqrt2e_2)$,其中 $e_1=(\frac1{\sqrt2},\frac1{\sqrt2})$,$e_2=(-\frac1{\sqrt2},\frac1{\sqrt2})$——棱互相垂直,是一个转了 45° 的正方形。

可逆算子把平行多面体映成平行多面体,特别地把盒子映成平行多面体——但一般不是盒子(长方形会被剪切成斜的平行四边形)。有没有「盒子进、盒子出」的情形?SVD 给出了答案:

定理每个可逆算子都把某些盒子映成盒子every invertible operator takes some boxes to boxes7.107

设 $T\in\mathcal L(V)$ 可逆,SVD 为 $Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_n\langle v,e_n\rangle f_n$。则对所有正数 $r_1,\dots,r_n$ 与所有 $u\in V$,$T$ 把盒子 $u+P(r_1e_1,\dots,r_ne_n)$ 映成盒子 $Tu+P(r_1s_1f_1,\dots,r_ns_nf_n)$。

证明思路

$T(u+a_1r_1e_1+\cdots+a_nr_ne_n)=Tu+a_1r_1s_1f_1+\cdots+a_nr_ns_nf_n$:沿 $e_k$ 的棱被送到沿 $f_k$ 的棱,长度乘 $s_k$;$f_k$ 仍互相垂直。

用奇异值计算体积 Volume via Singular Values

目标:理解算子怎样改变集合的体积。体积属于分析而非线性代数,所以这里只用直观的体积概念(可以用分析的工具严格化)。直观在实空间里最好用,下面常假设 $\mathbf F=\mathbf R$。$\dim V=n$ 时「体积」指 $n$ 维体积($n=2$ 时就是面积)。最基本的直观是:盒子的体积等于各棱长之积。

定义盒子的体积volume of a box7.108

设 $\mathbf F=\mathbf R$。若 $u\in V$,$r_1,\dots,r_n$ 为正数,$e_1,\dots,e_n$ 是规范正交基,则 $\operatorname{volume}\big(u+P(r_1e_1,\dots,r_ne_n)\big)=r_1\times\cdots\times r_n$。(例 7.106 的盒子面积是 $\sqrt2\times\sqrt2=2$。)

定义体积volume7.109

设 $\mathbf F=\mathbf R$,$\Omega\subseteq V$。$\Omega$ 的体积 $\operatorname{volume}\Omega$ 近似等于一组逼近 $\Omega$ 的互不相交的盒子的体积之和(就像 Riemann 积分用小长方形逼近曲线下的面积)。

这是一个不严格但直观的定义:它忽略了「换一组基的盒子来逼近,体积还一样吗?」「不相交的并,体积可加吗?」之类的问题——对足够好的集合,分析学会给出肯定的回答。

单位圆盘 ≈ 5 个盒子 T = diag(2, 1):每个盒子宽度 ×2、高度不变 ⇒ 面积 ×2
对应原书例 7.110:$Tv=2\langle v,e_1\rangle e_1+\langle v,e_2\rangle e_2$ 沿 $e_1$ 方向拉伸 2 倍。逼近圆盘的每个盒子都被映成宽度加倍、高度不变的盒子,面积都乘以 2,所以圆盘的面积也乘以 2。

例 7.110 之所以简单,是因为 $T$ 恰好把沿 $e_1,e_2$ 的盒子映成盒子。一般的算子会把盒子映成斜的平行多面体——但只要换用 SVD 给出的基来摆放盒子(7.107),盒子就还是盒子,每个盒子的体积都乘以 $s_1\cdots s_n$。这就是下面这个结果的自然证明:

体积按 $s_1s_2$ 缩放:沿奇异向量摆放的小盒子仍被映成小盒子

左图用小正方形(「盒子」,中心落在圆盘内的都算)逼近单位圆盘,右图是它们在 $T$ 下的像。勾选「沿 $e_1,e_2$ 摆放」时,盒子的棱沿右奇异向量,像仍是长方形(棱沿 $f_1,f_2$,长度乘 $s_1,s_2$);取消勾选则沿坐标轴摆放,像变成斜的平行四边形。拖动右图的空心圆点 $Te_1,Te_2$ 换一个 $T$;「盒子大小」越小,逼近越准。

无论盒子怎么摆,右图总面积 ÷ 左图总面积都等于 $s_1s_2$;沿 $e_1,e_2$ 摆放时,这一点一眼就能看出——每个小正方形都变成了 $s_1h\times s_2h$ 的长方形。盒子越小,左边的总面积越接近 $\pi$,右边越接近椭圆面积 $\pi s_1s_2$。$s_1s_2$ 也等于 $|\det T|$(第 9 章)。

定理体积按奇异值之积缩放volume changes by a factor of the product of the singular values7.111

设 $\mathbf F=\mathbf R$,$T\in\mathcal L(V)$ 可逆,$\Omega\subseteq V$,则

$$\operatorname{volume}T(\Omega)=(s_1\times\cdots\times s_n)\cdot\operatorname{volume}\Omega .$$(7.111)
证明思路

用形如 $u+P(r_1e_1,\dots,r_ne_n)$ 的盒子($e_k$ 来自 SVD)逼近 $\Omega$,每个体积 $r_1\cdots r_n$。由 7.107,$T$ 把它映成盒子 $Tu+P(r_1s_1f_1,\dots,r_ns_nf_n)$,体积 $(s_1\cdots s_n)(r_1\cdots r_n)$。逼近 $\Omega$ 的盒子被映成逼近 $T(\Omega)$ 的盒子,每个体积都乘以同一个因子,所以 $\Omega$ 的体积也乘以这个因子。

第 9 章会看到:奇异值之积等于 $|\det T|$(9.60、9.61)——这给了行列式「体积缩放倍数」的几何意义。

由特征值决定的算子性质 Properties of an Operator as Determined by Its Eigenvalues

本章最后,Axler 用一张表收束全章。背景是有限维复内积空间;第一列是正规算子可能具有的性质,第二列是 $\mathbf C$ 的一个子集:正规算子具有该性质,当且仅当它的所有特征值都落在这个子集里。

正规算子的性质特征值都落在为什么
可逆$\mathbf C\setminus\{0\}$0 不是特征值 ⟺ 单射(这一行不需要正规)
自伴$\mathbf R$对角矩阵等于共轭转置 ⟺ 对角元是实数(习题 7B.1)
skew($T^*=-T$)$\{\lambda:\operatorname{Re}\lambda=0\}$$\bar\lambda=-\lambda$ ⟺ 纯虚数(习题 7B.4)
正交投影$\{0,1\}$$\lambda^2=\lambda$,且自伴(习题 7B.3)
正算子$[0,\infty)$7.38 (a)⟺(b)
酉$\{\lambda:|\lambda|=1\}$7.55
范数小于 1$\{\lambda:|\lambda|\lt1\}$$\|T\|=s_1$(7.85),正规时奇异值 $=|\lambda_k|$(习题 7E.7)

这张表的道理只有一句话:由复谱定理,正规算子在某组规范正交基下是 $\operatorname{diag}(\lambda_1,\dots,\lambda_n)$,而上面每个性质对对角矩阵来说都只是「逐个检查对角元」。用下面的演示亲手检验每一行:

正规算子的「性格」由特征值在复平面上的位置决定

考虑 $\mathbf C^2$ 上的正规算子:由复谱定理,它在某组规范正交基 $u_1,u_2$ 下是 $\operatorname{diag}(\lambda_1,\lambda_2)$,即把坐标 $z_1$ 乘以 $\lambda_1$、$z_2$ 乘以 $\lambda_2$。在复平面上拖动 $\lambda_1$(蓝)和 $\lambda_2$(红)——它们正是灰色小旗「1」在两个坐标里的像(乘以 $\lambda=re^{i\theta}$ 就是旋转 $\theta$、放大 $r$ 倍)。靠近实轴、虚轴、单位圆、0 或 1 时会自动吸附。读数表实时判断各项性质。

实轴 ℝ(自伴) 虚轴(skew) 单位圆(酉) 单位圆内(范数 < 1)

把两个特征值都拖到实轴上,「自伴」变成 ✓;再都拖到正实轴,「正算子」也 ✓;拖到单位圆上,「酉」✓,此时 $\|T\|=1$;一个放在 0、一个放在 1,就是正交投影。只要有一个特征值落在 0,算子就不可逆。复谱定理把「算子」问题变成了「复数」问题——这正是整章类比表背后的真正原因。

剪切 $T=\begin{pmatrix} 1 & 1 \\ 0 & 1\end{pmatrix}$ 的范数 $\|T\|$ 是多少?

$T\in\mathcal L(\mathbf R^2)$ 的奇异值是 3 和 $\frac12$。单位圆盘在 $T$ 下的像的面积是多少?

线性映射的范数norm of a linear map$\|T\|=\max\{\|Tv\|:\|v\|\le1\}$ = 最大奇异值 $s_1$;$\|Tv\|\le\|T\|\,\|v\|$。
最佳低秩逼近best approximation (rank ≤ k)截断 SVD $T_k=\sum_{j\le k}s_j\langle\cdot,e_j\rangle f_j$ 使 $\|T-S\|$ 最小,最小值为 $s_{k+1}$(7.92)。
极分解polar decomposition$T=S\sqrt{T^*T}$,$S$ 酉、$\sqrt{T^*T}$ 正;类比 $z=\frac{z}{|z|}\cdot|z|$。
椭球ellipsoid$E(s_1f_1,\dots,s_nf_n)$:把单位球沿规范正交方向 $f_k$ 拉伸 $s_k$ 倍;可逆 $T$ 把球映成主轴为 $s_kf_k$ 的椭球。
平行多面体parallelepiped$u+P(v_1,\dots,v_n)$,$P=\{\sum a_kv_k:a_k\in(0,1)\}$;可逆算子把平行多面体映成平行多面体。
盒子box棱互相垂直的平行多面体 $u+P(r_1e_1,\dots,r_ne_n)$;体积 $r_1\cdots r_n$。
体积volume用互不相交的盒子逼近并求和;可逆 $T$ 使体积乘以 $s_1\cdots s_n$($=|\det T|$)。
本节要点
  • $\|T\|=s_1$:单位球被拉得最长的倍数;对不正规算子,它可能远大于 $\max|\lambda|$。
  • 截断 SVD 是最佳低秩逼近,误差恰为第一个被丢掉的奇异值 $s_{k+1}$。
  • 极分解 $T=S\sqrt{T^*T}$ = SVD 的重新分组:先沿垂直方向纯拉伸,再纯旋转。
  • 可逆算子:球 → 椭球(主轴 $s_kf_k$),沿 $e_k$ 的盒子 → 沿 $f_k$ 的盒子,体积 × $s_1\cdots s_n$。
  • 正规算子($\mathbf C$)的各种性质 ⟺ 特征值落在复平面的对应区域。

本章小结

  • 伴随 $T^*$:$\langle Tv,w\rangle=\langle v,T^*w\rangle$;规范正交基下是共轭转置;$\operatorname{null}T^*=(\operatorname{range}T)^\perp$,$\operatorname{range}T^*=(\operatorname{null}T)^\perp$。
  • 自伴($T=T^*$)特征值是实数;正规($TT^*=T^*T$)⟺ $\|Tv\|=\|T^*v\|$,不同特征值的特征向量互相垂直。
  • 谱定理:有规范正交特征基 ⟺ 自伴($\mathbf R$)/ 正规($\mathbf C$)。图像:沿互相垂直的轴伸缩(复情形:每个方向乘一个复数)。
  • 正算子 = 自伴 + $\langle Tv,v\rangle\ge0$ = 特征值 ≥ 0 = $R^*R$;有唯一正平方根 $\sqrt T$。
  • 等距 ⟺ $S^*S=I$ ⟺ 保内积 ⟺ 列规范正交;酉算子:$S^*S=SS^*=I$,特征值在单位圆上。QR = Gram–Schmidt 的矩阵记录;Cholesky:正定 $B=R^*R$。
  • 奇异值 = $\sqrt{T^*T\text{ 的特征值}}$;SVD $Tv=\sum s_k\langle v,e_k\rangle f_k$:转—拉—转,对任意线性映射成立;$T^*$、$T^\dagger$ 可直接读出;矩阵形式 $A=BDC^*$。
  • 推论:$\|T\|=s_1$;截断 SVD 是最佳低秩逼近(误差 $s_{k+1}$);极分解 $T=S\sqrt{T^*T}$;球 → 椭球(主轴 $s_kf_k$);体积 × $s_1\cdots s_n$。
  • 主线类比:算子 ↔ 复数。它之所以成立,是因为(复)谱定理把正规算子变成了「若干个独立的复数」。

概念之间的联系:伴随 → 自伴/正规 → 谱定理 → 正算子与 $\sqrt{\ \cdot\ }$ → 对 $T^*T$ 用谱定理 → SVD → 范数、低秩逼近、极分解、体积。另一条线:Gram–Schmidt → QR → (借助 $B=A^*A$)Cholesky。

算子类定义特征值($\mathbf F=\mathbf C$)几何图像复数类比
自伴$T=T^*$实数沿垂直轴伸缩(可翻转)实数
正自伴且 $\langle Tv,v\rangle\ge0$$\ge0$沿垂直轴非负伸缩非负数
酉$S^*S=SS^*=I$$|\lambda|=1$旋转 / 反射,保长度单位圆
正规$TT^*=T^*T$任意垂直方向上各乘一个复数任意复数
一般算子—任意(可能无实特征值)SVD:转—拉—转;极分解 $S\sqrt{T^*T}$$z=\frac{z}{|z|}\cdot|z|$

自测

各节中已穿插了 9 道测验,这里再做几道综合题。

$\dim V\ge2$ 时,单位算子 $I$ 有多少个平方根?其中正的有几个?

在 QR 分解 $A=QR$ 中,$R$ 的第 $k$ 列记录的是什么?

$T\in\mathcal L(\mathbf R^3,\mathbf R^2)$(从 3 维空间到 2 维空间)有几个奇异值?最多有几个是正的?

$T$ 的奇异值是 $5,3,1$。在所有值域维数 ≤ 1 的线性映射 $S$ 中,$\|T-S\|$ 的最小值是多少?

极分解 $T=S\sqrt{T^*T}$ 中,决定单位圆的像(椭圆)形状——即两个半轴长度——的是哪个因子?

一个 2×2 实对称矩阵把单位圆映成一个椭圆。这个椭圆的主轴方向是?

习题

选自原书各节末的习题(编号与原书一致)。先自己动手,再展开提示与解答。

7A.1设 $n$ 为正整数,$T\in\mathcal L(\mathbf F^n)$ 定义为 $T(z_1,\dots,z_n)=(0,z_1,\dots,z_{n-1})$(「右移」)。求 $T^*(z_1,\dots,z_n)$ 的公式。
提示用本章的通用技巧:写出 $\langle Tz,w\rangle$,整理成 $\langle z,\ \cdots\rangle$ 的形式。
参考解答

对 $z,w\in\mathbf F^n$,$\langle Tz,w\rangle=0\cdot\overline{w_1}+z_1\overline{w_2}+\cdots+z_{n-1}\overline{w_n}=\langle (z_1,\dots,z_n),\ (w_2,\dots,w_n,0)\rangle$。所以 $T^*(w_1,\dots,w_n)=(w_2,\dots,w_n,0)$——右移的伴随是左移。矩阵上看:$\mathcal M(T)$ 是次对角线为 1 的下三角矩阵,其转置是超对角线为 1 的上三角矩阵。

7A.3设 $T\in\mathcal L(V)$,$\lambda\in\mathbf F$。证明:$\lambda$ 是 $T$ 的特征值 ⟺ $\bar\lambda$ 是 $T^*$ 的特征值。
提示「不是特征值」⟺「$T-\lambda I$ 可逆」;再用 7.5(f) 与 $(T-\lambda I)^*=T^*-\bar\lambda I$。
参考解答

由 7.5(a)(b)(e),$(T-\lambda I)^*=T^*-\bar\lambda I$。于是:$\lambda$ 不是 $T$ 的特征值 ⟺ $T-\lambda I$ 可逆 ⟺ $(T-\lambda I)^*=T^*-\bar\lambda I$ 可逆(⇒ 用 7.5(f);⇐ 对 $T^*-\bar\lambda I$ 再用 7.5(f),并注意 $(S^*)^*=S$)⟺ $\bar\lambda$ 不是 $T^*$ 的特征值。取逆否即得。注意:特征值取共轭对应,但特征向量一般不同;正规算子则连特征向量都相同(7.21(e))。

7A.23设 $T$ 是 $V$ 上的正规算子,$v,w\in V$ 满足 $\|v\|=\|w\|=2$,$Tv=3v$,$Tw=4w$。证明 $\|T(v+w)\|=10$。
提示正规算子属于不同特征值的特征向量有什么关系?然后用勾股定理。
参考解答

$3\ne4$,由 7.22,$v\perp w$,从而 $3v\perp4w$。于是由勾股定理,$\|T(v+w)\|^2=\|3v+4w\|^2=9\|v\|^2+16\|w\|^2=36+64=100$,所以 $\|T(v+w)\|=10$。(若 $T$ 不正规,$v,w$ 未必垂直,结论可能不成立。)

7B.2设 $\mathbf F=\mathbf C$,$T\in\mathcal L(V)$ 正规且只有一个特征值。证明 $T$ 是恒等算子的数量倍。
提示复谱定理给出的对角矩阵,对角线上只能是什么?
参考解答

由复谱定理,$V$ 有由 $T$ 的特征向量构成的规范正交基 $e_1,\dots,e_n$,$Te_k=\lambda_ke_k$。每个 $\lambda_k$ 都是 $T$ 的特征值,而 $T$ 只有一个特征值 $\lambda$,所以 $\lambda_k=\lambda$,$\mathcal M(T)=\lambda I$,即 $T=\lambda I$。(「正规」不能去掉:剪切 $\begin{pmatrix} 1 & 1 \\ 0 & 1\end{pmatrix}$ 只有特征值 1,却不是 $I$。)

7B.21设 $T$ 是有限维内积空间上的自伴算子,且 2 和 3 是 $T$ 仅有的特征值。证明 $T^2-5T+6I=0$。(再想想:习题 7B.22 要你在 $\mathbf C^3$ 中找一个特征值也只有 2、3,但 $T^2-5T+6I\ne0$ 的算子。)
提示用谱定理:取一组规范正交特征基,看 $T^2-5T+6I$ 作用在每个基向量上的结果。
参考解答

由谱定理(7.29 或 7.31),$V$ 有由 $T$ 的特征向量构成的规范正交基 $e_1,\dots,e_n$,$Te_k=\lambda_ke_k$,$\lambda_k\in\{2,3\}$。于是 $(T^2-5T+6I)e_k=(\lambda_k^2-5\lambda_k+6)e_k=(\lambda_k-2)(\lambda_k-3)e_k=0$。一个线性映射在一组基上为 0,就处处为 0。

对于 7B.22:取 $\mathcal M(T)=\begin{pmatrix} 2 & 1 & 0 \\ 0 & 2 & 0 \\ 0 & 0 & 3\end{pmatrix}$,特征值只有 2、3,但 $(T-2I)(T-3I)$ 的 $(1,2)$ 元是 $-1\ne0$。它不是正规的,谱定理不适用。

7C.3设 $n$ 为正整数,$T\in\mathcal L(\mathbf F^n)$ 在标准基下的矩阵元素全为 1。证明 $T$ 是正算子。
提示直接算 $\langle Tx,x\rangle$:$Tx$ 的每个分量都是 $x_1+\cdots+x_n$。
参考解答

矩阵是实对称的,由 7.9 知 $T$ 自伴。设 $x=(x_1,\dots,x_n)$,$\sigma=x_1+\cdots+x_n$,则 $Tx=(\sigma,\dots,\sigma)$,$\langle Tx,x\rangle=\sigma\overline{x_1}+\cdots+\sigma\overline{x_n}=\sigma\bar\sigma=|\sigma|^2\ge0$。所以 $T$ 是正算子。(另法:$T$ 的特征值是 $n$(特征向量 $(1,\dots,1)$)和 $0$(其正交补),都 ≥ 0,用 7.38(b)。这也解释了例 7.90 中 $\|T\|=n$。)

7C.10设 $T$ 是 $V$ 上的正算子,$v,w\in V$ 满足 $Tv=w$ 且 $Tw=v$。证明 $v=w$。
提示考虑 $\langle T(v-w),\,v-w\rangle$。
参考解答

$T(v-w)=Tv-Tw=w-v$。所以 $\langle T(v-w),v-w\rangle=\langle w-v,\,v-w\rangle=-\|v-w\|^2\le0$。但 $T$ 是正算子,左边 $\ge0$。故 $\|v-w\|^2=0$,即 $v=w$。(直观:$T$ 把 $v-w$ 送到它的反方向,与「$Tu$ 与 $u$ 的夹角不超过 90°」矛盾,除非 $v-w=0$。)

7C.19证明 $\mathbf F^2$ 上的单位算子有无穷多个自伴的平方根。
提示想想反射:关于一条直线反射两次回到原处。
参考解答

对每个 $\theta\in\mathbf R$,令 $\mathcal M(R_\theta)=\begin{pmatrix} \cos\theta & \sin\theta \\ \sin\theta & -\cos\theta\end{pmatrix}$。它是实对称矩阵,所以 $R_\theta$ 自伴($\mathbf F=\mathbf C$ 时也一样,因为元素都是实数)。直接计算:$R_\theta^2$ 的对角元是 $\cos^2\theta+\sin^2\theta=1$,非对角元是 $\cos\theta\sin\theta-\sin\theta\cos\theta=0$,所以 $R_\theta^2=I$。不同的 $\theta\in[0,2\pi)$ 给出不同的矩阵,因此有无穷多个。($R_\theta$ 是关于与 $x$ 轴夹角 $\theta/2$ 的直线的反射;它的特征值是 $1,-1$,所以它不是正算子——与 7.39 一致。)

7D.3(a) 证明 $V$ 上两个酉算子的乘积是酉算子;(b) 证明酉算子的逆是酉算子。(因此 $V$ 上的酉算子在乘法下构成一个群。)
提示用 7.53:酉 ⟺ $S^*S=SS^*=I$;以及 $(ST)^*=T^*S^*$。
参考解答

(a) 设 $S,T$ 酉。$(ST)^*(ST)=T^*S^*ST=T^*T=I$,$(ST)(ST)^*=STT^*S^*=SS^*=I$,由 7.53(b) $ST$ 是酉算子。几何上:两次保长度,结果仍保长度。(b) 若 $S$ 酉,则 $S^{-1}=S^*$(7.53(c)),而 $S^*$ 是酉的(7.53(f))。

7D.18方阵 $A$ 称为对称的,如果它等于自己的转置。证明:若 $A$ 是实对称矩阵,则存在实的酉矩阵 $Q$,使 $Q^*AQ$ 是对角矩阵。
提示把 $A$ 看成 $\mathbf R^n$(欧氏内积)上的算子,用实谱定理;再把规范正交特征基排成 $Q$ 的列。
参考解答

设 $T\in\mathcal L(\mathbf R^n)$ 在标准基(规范正交基)下的矩阵是 $A$。$A=A^{\mathrm t}$,由 7.9 知 $T=T^*$,即 $T$ 自伴。由实谱定理,$\mathbf R^n$ 有由 $T$ 的特征向量构成的规范正交基 $q_1,\dots,q_n$,$Aq_k=\lambda_kq_k$,$\lambda_k\in\mathbf R$。令 $Q$ 是以 $q_1,\dots,q_n$ 为列的实矩阵,它的列规范正交,所以是酉矩阵,且 $Q^*=Q^{\mathrm t}=Q^{-1}$。又 $AQ=Q\Lambda$,$\Lambda=\operatorname{diag}(\lambda_1,\dots,\lambda_n)$。两边左乘 $Q^*$ 得 $Q^*AQ=\Lambda$。

7E.5设 $T\in\mathcal L(\mathbf C^2)$ 定义为 $T(x,y)=(-4y,\ x)$。求 $T$ 的奇异值。
提示先写出 $\mathcal M(T)$,算 $\mathcal M(T)^*\mathcal M(T)$。
参考解答

$\mathcal M(T)=\begin{pmatrix} 0 & -4 \\ 1 & 0\end{pmatrix}$,$\mathcal M(T^*T)=\begin{pmatrix} 0 & 1 \\ -4 & 0\end{pmatrix}\begin{pmatrix} 0 & -4 \\ 1 & 0\end{pmatrix}=\begin{pmatrix} 1 & 0 \\ 0 & 16\end{pmatrix}$,特征值 16、1,所以奇异值是 $4,1$。几何上:$T$ 把 $e_2$ 拉长 4 倍、$e_1$ 长度不变,并把它们转到互相垂直的新位置。对比:$T$ 的特征值是 $\pm2i$($|\lambda|=2$),与奇异值不同——$T$ 不是正规的($TT^*=\operatorname{diag}(16,1)\ne T^*T$)。

7E.10设 $T\in\mathcal L(V,W)$ 可逆,奇异值为 $s_1\ge\cdots\ge s_n$。证明 $T^{-1}$ 的奇异值是 $\dfrac1{s_n}\ge\cdots\ge\dfrac1{s_1}$。
提示用 SVD 与 7.78:可逆时 $T^\dagger=T^{-1}$。或者直接验证 $(T^{-1})^*T^{-1}f_k=\dfrac{1}{s_k^2}f_k$。
参考解答

$T$ 可逆,所以所有 $s_k\gt0$,SVD 为 $Tv=\sum_{k=1}^n s_k\langle v,e_k\rangle f_k$,$e_k$、$f_k$ 分别是 $V$、$W$ 的规范正交基,$Te_k=s_kf_k$。于是 $T^{-1}f_k=e_k/s_k$;又由 7.77,$T^*f_k=s_ke_k$,所以 $(T^{-1})^*e_k=(T^*)^{-1}e_k=f_k/s_k$(用 7.5(f):$(T^{-1})^*=(T^*)^{-1}$)。合起来 $(T^{-1})^*T^{-1}f_k=\dfrac{1}{s_k^2}f_k$:$(T^{-1})^*T^{-1}$ 有规范正交特征基 $f_1,\dots,f_n$,特征值 $1/s_k^2$。开方并按降序排列,$T^{-1}$ 的奇异值是 $1/s_n\ge\cdots\ge1/s_1$。几何上:$T$ 把单位球压扁得越厉害,$T^{-1}$ 就要拉得越厉害(例 7.90 中 $\|T^{-1}\|\approx10^6$)。

7F.6证明或举反例:若 $S,T\in\mathcal L(V)$,则 $\|ST\|=\|TS\|$。
提示找两个 2×2 矩阵,使 $ST=0$ 而 $TS\ne0$。
参考解答

结论不成立。取 $\mathcal M(S)=\begin{pmatrix} 0 & 1 \\ 0 & 0\end{pmatrix}$,$\mathcal M(T)=\begin{pmatrix} 1 & 0 \\ 0 & 0\end{pmatrix}$。则 $\mathcal M(ST)=\begin{pmatrix} 0 & 0 \\ 0 & 0\end{pmatrix}$,$\|ST\|=0$;而 $\mathcal M(TS)=\begin{pmatrix} 0 & 1 \\ 0 & 0\end{pmatrix}$,它把 $e_2$ 送到 $e_1$,$\|TS\|=1$。(但总有 $\|ST\|\le\|S\|\,\|T\|$,见习题 7F.5。)

7F.15定义 $T\in\mathcal L(\mathbf F^3)$ 为 $T(z_1,z_2,z_3)=(z_3,\ 2z_1,\ 3z_2)$。明确求出一个酉算子 $S\in\mathcal L(\mathbf F^3)$,使 $T=S\sqrt{T^*T}$。
提示先看 $T$ 把标准基送到哪里:$Te_1=2e_2$,$Te_2=3e_3$,$Te_3=e_1$。它们互相垂直,于是 $T^*T$ 很容易算。
参考解答

$Te_1=2e_2$,$Te_2=3e_3$,$Te_3=e_1$ 两两正交,所以 $\langle T^*Te_j,e_k\rangle=\langle Te_j,Te_k\rangle$ 只在 $j=k$ 时非零:$T^*T=\operatorname{diag}(4,9,1)$,于是 $\sqrt{T^*T}=\operatorname{diag}(2,3,1)$(正的、平方为 $T^*T$,由 7.39 唯一)。它可逆,令 $S=T\big(\sqrt{T^*T}\big)^{-1}$:$Se_1=T(e_1/2)=e_2$,$Se_2=T(e_2/3)=e_3$,$Se_3=Te_3=e_1$,即

$S(z_1,z_2,z_3)=(z_3,\ z_1,\ z_2)$。

$S$ 把标准基排列成标准基,是酉算子(7.53(d)),且 $S\sqrt{T^*T}(z_1,z_2,z_3)=S(2z_1,3z_2,z_3)=(z_3,2z_1,3z_2)=T(z_1,z_2,z_3)$。$T$ 可逆,所以这个 $S$ 是唯一的(习题 7F.26)。

7F.19证明:若 $T\in\mathcal L(V,W)$,则 $\|T^*T\|=\|T\|^2$。
提示$T^*T$ 是正算子,它的特征值是什么?或者用两个不等式 $\|T^*T\|\le\|T^*\|\,\|T\|$ 与 $\|Tv\|^2=\langle T^*Tv,v\rangle$。
参考解答

方法一:$T^*T$ 有规范正交特征基 $e_1,\dots,e_n$,特征值 $s_1^2\ge\cdots\ge s_n^2$。由例 7.90 的第三条,$\|T^*T\|=\max_k s_k^2=s_1^2=\|T\|^2$。

方法二:一方面 $\|T^*Tv\|\le\|T^*\|\,\|Tv\|\le\|T^*\|\,\|T\|\,\|v\|$,结合 7.91 得 $\|T^*T\|\le\|T\|^2$;另一方面 $\|Tv\|^2=\langle T^*Tv,v\rangle\le\|T^*Tv\|\,\|v\|\le\|T^*T\|\,\|v\|^2$,所以 $\|T\|^2\le\|T^*T\|$。(这个等式是 $C^*$-代数理论的起点。)

第 8 章

复向量空间上的算子 Operators on Complex Vector Spaces

特征向量不够用怎么办?本章用「广义特征向量」补上缺口:在复向量空间上,每个算子都能拆成若干块「数乘 + 幂零」,由此得到分块对角矩阵、Jordan 标准形、平方根与 Cayley–Hamilton 定理;最后用「迹」把矩阵与算子联系起来。

学习目标
  • 说清楚为什么 $\operatorname{null} T\subseteq\operatorname{null}T^2\subseteq\cdots$ 最迟在第 $\dim V$ 步停止增长,以及 $V=\operatorname{null}T^{n}\oplus\operatorname{range}T^{n}$ 的含义。
  • 掌握广义特征向量、广义特征空间、幂零算子的定义,并能用「链」的图像理解它们。
  • 理解广义特征空间分解(8.22):在 ℂ 上,每个算子在每个广义特征空间上都是「$\lambda I$ + 幂零」。
  • 区分代数重数与几何重数,会写特征多项式,理解 Cayley–Hamilton 定理为何成立。
  • 会读 Jordan 标准形:一条链对应一个 Jordan 块,并能为简单算子找出 Jordan 基。
  • 理解迹:它与基无关、等于特征值(按重数)之和,并能用它证明 $ST-TS\neq I$。
一分钟速览
  • 零空间链 $\operatorname{null}T\subseteq\operatorname{null}T^2\subseteq\cdots$ 只要有一步不再增长就永远停住,而且最迟在第 $\dim V$ 步停住;停住之后 $V=\operatorname{null}T^{n}\oplus\operatorname{range}T^{n}$($n=\dim V$)。
  • 特征向量可能不够(例如剪切只有一条特征方向)。广义特征向量放宽条件:只要 $(T-\lambda I)^k v=0$ 对某个 $k$ 成立即可。
  • 幂零算子是某个幂等于 0 的算子:它把向量沿着一条条「链」往下推,推到底就掉进 0。
  • 广义特征空间分解(8.22):在 ℂ 上 $V=G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T)$,而且 $T$ 在每一块上等于 $\lambda_k I$ 加一个幂零算子。
  • 重数 $=\dim G(\lambda,T)$(代数重数),它 $\ge\dim E(\lambda,T)$(几何重数);特征多项式 $\prod (z-\lambda_k)^{d_k}$ 满足 Cayley–Hamilton 定理 $q(T)=0$。
  • Jordan 标准形(8.46):选好基后,矩阵只剩对角线上的特征值和紧挨在对角线上方的若干个 1——每条链就是一个 Jordan 块。
  • 在 ℂ 上可逆算子都有平方根(8.41):$\sqrt{1+x}$ 的泰勒级数遇到幂零算子会自动截断成有限和。
  • 迹 = 对角元之和,换基不变(因为 $\operatorname{tr}(AB)=\operatorname{tr}(BA)$),在 ℂ 上等于特征值之和;于是永远不可能有 $ST-TS=I$。
本章地图 8A 广义特征向量 8B 分解 8C 推论 · 8D 迹 零空间链停止增长8.1–8.3 V = null Tⁿ ⊕ range Tⁿ8.4 广义特征向量8.8–8.12 · 在 ℂ 上能成基 幂零算子8.14–8.18 · 某个幂为 0 广义特征空间分解8.22 · V = ⊕ G(λₖ,T) 重数与特征多项式8.23–8.31 · Cayley–Hamilton 分块对角矩阵8.35–8.38 · 上三角块 算子的平方根8.39–8.41 · 可逆 ⇒ 有平方根 Jordan 标准形8.42–8.46 · 链 ↔ Jordan 块 迹 trace8.47–8.57 · 与基无关 = Σλ

实线箭头:「用到 / 推出」;虚线:幂零算子是分解 8.22(b) 的「零件」,也是 Jordan 形(先证幂零情形 8.45)的出发点。点击方框可跳到对应小节。

本章约定 (standing assumptions)
  • $\mathbf{F}$ 表示 $\mathbf{R}$ 或 $\mathbf{C}$;$V$ 表示 $\mathbf{F}$ 上的有限维非零向量空间。
  • 本章不默认 $\mathbf{F}=\mathbf{C}$:有些结果在 ℝ 上也成立;凡是需要 ℂ 的地方(主要是「特征值一定存在」这一步)会单独写明「设 $\mathbf{F}=\mathbf{C}$」。
  • 内积对这些内容帮不上忙,所以本章回到一般的有限维向量空间(只有 8.55 等个别结果提到内积)。图中画的长度与角度只是为了好看,本章的结论都与长度、角度无关。

为什么需要这一章?第 5 章告诉我们:算子可对角化 ⇔ 有一组由特征向量组成的基 ⇔ $V$ 是各特征空间的直和 5.55。第 7 章的谱定理说,自伴算子(ℝ 上)和正规算子(ℂ 上)总能对角化 7.297.31。可是最朴素的剪切 $T(x,y)=(x+y,\ y)$ 就做不到:它只有一条特征方向(横轴),二维空间只「分到」一条特征直线。

本章回答:对任意算子(特别是在 ℂ 上),最好的「拆解」是什么?路线分三步——

  1. 放宽「特征向量」:不再要求 $(T-\lambda I)v=0$,只要求 $(T-\lambda I)^k v=0$(8A)。
  2. 按特征值分房间:在 ℂ 上,$V$ 恰好是各广义特征空间的直和,$T$ 在每个「房间」里只做两件事——乘以 $\lambda$,再加一个迟早会消失的「漂移」(幂零算子)(8B)。
  3. 把漂移整理成链:幂零算子总能排成若干条「链」,于是矩阵变成 Jordan 标准形(8C)。
同一个算子,基选得越好,矩阵里的 0 越多:第 5 章的上三角形 5.44 → 本章的分块对角形 8.37 → Jordan 形 8.46。彩色格 = 特征值,灰色 ∗ = 任意数,空白 = 0。

8A 广义特征向量与幂零算子 Generalized Eigenvectors and Nilpotent Operators

这一节要解决:特征向量不够组成一组基时,拿什么来代替?我们先研究算子的幂 $T,T^2,T^3,\dots$ 的零空间——它们会越长越大,但很快就停下来;再用它定义「广义特征向量」;最后认识一类特别重要的算子——幂零算子。

算子幂的零空间 Null Spaces of Powers of an Operator

直觉 把 $T$ 想成一台机器,每按一次按钮就把所有向量「处理」一遍。$\operatorname{null}T^k$ 就是「连按 $k$ 次后变成 0 的向量」。按 $k$ 次就消失的,按 $k+1$ 次当然也消失——所以这些零空间一个套一个地变大。问题是:它会一直长下去吗?
命题递增的零空间序列sequence of increasing null spaces8.1

设 $T\in\mathcal{L}(V)$,则 $$\{0\}=\operatorname{null}T^0\subseteq\operatorname{null}T^1\subseteq\cdots\subseteq\operatorname{null}T^k\subseteq\operatorname{null}T^{k+1}\subseteq\cdots$$

证明

若 $T^k v=0$,则 $T^{k+1}v=T(T^k v)=T(0)=0$,所以 $\operatorname{null}T^k\subseteq\operatorname{null}T^{k+1}$。(约定 $T^0=I$,所以 $\operatorname{null}T^0=\{0\}$。)

下面这个结果说:只要链条中相邻两项相等一次,之后就永远相等——楼梯一旦出现「平台」,就再也不会往上走。

命题零空间序列中的相等equality in the sequence of null spaces8.2

设 $T\in\mathcal{L}(V)$,$m$ 是非负整数,且 $\operatorname{null}T^m=\operatorname{null}T^{m+1}$。那么 $$\operatorname{null}T^m=\operatorname{null}T^{m+1}=\operatorname{null}T^{m+2}=\operatorname{null}T^{m+3}=\cdots$$

证明思路

核心想法:「多按一次没有新的受害者」这件事会一直传递下去。设 $v$ 在第 $m+k+1$ 次时消失,即 $T^{m+k+1}v=0$。把它看成 $T^{m+1}(T^k v)=0$,于是 $T^k v\in\operatorname{null}T^{m+1}=\operatorname{null}T^m$,即 $T^{m+k}v=T^m(T^k v)=0$。所以 $\operatorname{null}T^{m+k+1}\subseteq\operatorname{null}T^{m+k}$,而反方向的包含由 8.1 保证。

命题零空间停止增长null spaces stop growing8.3

设 $T\in\mathcal{L}(V)$,则 $\operatorname{null}T^{\dim V}=\operatorname{null}T^{\dim V+1}=\operatorname{null}T^{\dim V+2}=\cdots$

证明思路

数台阶:由 8.2,只需证 $\operatorname{null}T^{\dim V}=\operatorname{null}T^{\dim V+1}$。若不然,由 8.1、8.2,从 $\{0\}$ 到 $\operatorname{null}T^{\dim V+1}$ 的每一步都是真包含(中间一旦相等就会一直相等)。每一步真包含至少让维数 +1,共 $\dim V+1$ 步,于是 $\dim\operatorname{null}T^{\dim V+1}\ge\dim V+1$——子空间的维数不可能超过 $\dim V$,矛盾。

直觉:一座最多 dim V 级的楼梯 把 $\dim\operatorname{null}T^k$ 画成关于 $k$ 的折线:它从 0 开始,每一步要么严格上升(至少 +1),要么进入平台;一进平台就永远是平台(8.2)。而高度不能超过 $\dim V$,所以最多 $\dim V$ 次上升,第 $\dim V$ 步时一定已经在平台上(8.3)。

一般来说 $V=\operatorname{null}T\oplus\operatorname{range}T$ 不成立(下面的例 8.6 就是反例)。但把 $T$ 换成足够高的幂,它就成立了——这是本章最有用的「替代品」。

定理$V$ 是 $\operatorname{null}T^{\dim V}$ 与 $\operatorname{range}T^{\dim V}$ 的直和V is the direct sum of null T^(dim V) and range T^(dim V)8.4

设 $T\in\mathcal{L}(V)$,$n=\dim V$,则 $$V=\operatorname{null}T^{n}\oplus\operatorname{range}T^{n}.$$

证明思路

第一步:两者只交于 0 8.5。设 $v\in\operatorname{null}T^n\cap\operatorname{range}T^n$,则 $T^n v=0$,且 $v=T^n u$。于是 $T^{2n}u=T^n v=0$,即 $u\in\operatorname{null}T^{2n}=\operatorname{null}T^n$(8.3),所以 $v=T^n u=0$。

第二步:维数凑满。交为 $\{0\}$ 说明和是直和(1.46);再由线性映射基本定理(3.21),$\dim\operatorname{null}T^n+\dim\operatorname{range}T^n=\dim V$,所以这个直和就是 $V$(2.39)。

直觉:「会被消灭的」与「永远消灭不了的」 $\operatorname{null}T^{n}$ 收集的是「迟早被 $T$ 消灭的向量」;$\operatorname{range}T^{n}$ 则是 $T$ 反复作用后仍然「活着」的部分——在它上面 $T$ 是可逆的(值域链也在此处稳定下来,$T$ 把 $\operatorname{range}T^n$ 映满自己)。定理说这两部分恰好把 $V$ 劈成两半。低次幂时两部分可能「纠缠」(交集非零),要等零空间链稳定后才分得干净。
例$\mathbf{F}^3=\operatorname{null}T^3\oplus\operatorname{range}T^3$F³ = null T³ ⊕ range T³8.6

设 $T(z_1,z_2,z_3)=(4z_2,\ 0,\ 5z_3)$。则 $\operatorname{null}T=\{(z_1,0,0)\}$,$\operatorname{range}T=\{(z_1,0,z_3)\}$。两者的交是整条 $z_1$ 轴,所以 $\operatorname{null}T+\operatorname{range}T$ 不是直和,而且它也凑不满 $\mathbf{F}^3$。

但 $T^3(z_1,z_2,z_3)=(0,0,125z_3)$,于是 $\operatorname{null}T^3=\{(z_1,z_2,0)\}$,$\operatorname{range}T^3=\{(0,0,z_3)\}$,正好 $\mathbf{F}^3=\operatorname{null}T^3\oplus\operatorname{range}T^3$,与 8.4 一致。(其实 $k=2$ 时就已经分开了——在下面的演示里验证。)

零空间越长越大、值域越缩越小(ℝ³ 中的 3D 图)

选一个算子,拖动滑块 $k$:蓝色是 $\operatorname{null}T^k$,橙红色是 $\operatorname{range}T^k$(圆点 = {0},直线 = 1 维,平面 = 2 维,立方框 = 整个 ℝ³),紫色粗线是两者的交。在左图中按住拖动可旋转视角;右图是维数「楼梯」,竖条标出当前的 $k$。

例 8.6 中 $k=1$ 时,蓝色直线($z_1$ 轴)整条躺在橙色平面里——交集非零,不是直和;从 $k=2$ 起,蓝色平面与橙色直线只在原点相交,ℝ³ = null Tᵏ ⊕ range Tᵏ。所有例子里「楼梯」都在 $k\le 3=\dim V$ 时进入平台,而且一旦持平就永远持平(8.2、8.3)。幂零的例子中,蓝色最终吞掉整个 ℝ³、橙色缩成 {0};可逆算子则恰好相反。

值域链:方向相反的楼梯 类似地 $V=\operatorname{range}T^0\supseteq\operatorname{range}T^1\supseteq\operatorname{range}T^2\supseteq\cdots$,它也是一旦持平就永远持平,并在 $\dim V$ 步内稳定(原书习题 8A.6–8)。由维数公式 $\dim\operatorname{null}T^k+\dim\operatorname{range}T^k=\dim V$,两条链同时停下(习题 8A.9)——演示右图中蓝、橙两条折线恰好互为镜像。

设 $\dim V=5$,已知 $\operatorname{null}T^2=\operatorname{null}T^3$。下列哪一项一定成立?

广义特征向量 Generalized Eigenvectors

为什么需要比特征向量更多的东西?想描述算子 $T$,一个自然的办法是把 $V$ 拆成若干个 $T$ 不变子空间的直和 $V=V_1\oplus\cdots\oplus V_n$,然后分别研究 $T$ 在每一块上的行为。最简单的不变子空间是一维的——它们正是由特征向量张成的。能拆成一维不变子空间 ⇔ 有特征向量组成的基 ⇔ $V$ 有特征空间分解

$$V=E(\lambda_1,T)\oplus\cdots\oplus E(\lambda_m,T)$$(8.7)

其中 $\lambda_1,\dots,\lambda_m$ 是 $T$ 的全部互异特征值(见 5.55)。谱定理保证自伴算子($\mathbf{F}=\mathbf{R}$)与正规算子($\mathbf{F}=\mathbf{C}$)总有这样的分解;但一般算子未必有,即使在 ℂ 上也不行——例 5.57 的 $T(a,b,c)=(b,c,0)$ 就只有一条特征直线。下面的演示让你亲眼看到特征向量是怎么「不够用」的。

两条特征方向合并成一条:2×2 Jordan 块

算子 $T_\varepsilon=\begin{pmatrix}1 & 1\\ 0 & 1+\varepsilon\end{pmatrix}$ 有特征值 $1$ 与 $1+\varepsilon$。拖动 $\varepsilon$ 滑块,看两条特征方向(虚线)如何靠拢;拖动紫色向量 $v$,看它按平行四边形法则沿两条特征方向的分解。点「ε = 0」进入 Jordan 块情形。

$\varepsilon$ 越接近 0,两条虚线越靠拢,$v$ 沿它们分解的系数就越大(大约像 $1/\varepsilon$ 那样爆炸)——特征基变得越来越「病态」。到 $\varepsilon=0$ 时两条方向彻底重合,特征向量再也凑不成基。但此时出现了新现象:对任何 $v$,$(T-I)v$ 都落在唯一的特征直线上,再作用一次就是 0。也就是说 $(T-I)^2v=0$ 对所有 $v$ 成立。

这正是下面定义的动机:把条件 $(T-\lambda I)v=0$ 放宽为「$(T-\lambda I)$ 作用若干次后为 0」。

定义广义特征向量generalized eigenvector8.8

设 $T\in\mathcal{L}(V)$,$\lambda$ 是 $T$ 的特征值。向量 $v\in V$ 称为 $T$ 的对应于 $\lambda$ 的广义特征向量,如果 $v\neq0$,且存在正整数 $k$ 使得 $$(T-\lambda I)^k v=0.$$

  • 特征向量是 $k=1$ 的特例。广义特征向量的直观含义:它不一定被 $T-\lambda I$ 一步消灭,但走几步一定会被消灭。
  • $k$ 不用很大。把 8.1、8.3 用到算子 $T-\lambda I$ 上:非零向量 $v$ 是广义特征向量 ⇔ $(T-\lambda I)^{\dim V}v=0$。
  • 没有「广义特征值」。若 $(T-\lambda I)^k$ 不是单射,则 $T-\lambda I$ 也不是单射(单射的复合仍是单射),所以 $\lambda$ 本来就是特征值——定义新的「广义特征值」不会带来任何新东西(原书页边注)。

特征向量可能凑不成基;而在 ℂ 上,广义特征向量总是够用的:

定理由广义特征向量组成的基a basis of generalized eigenvectors8.9

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 $V$ 有一组由 $T$ 的广义特征向量组成的基。

证明思路(对 dim V 归纳)

核心想法:用 8.4 把 $V$ 劈成两块,一块全是 $\lambda$ 的广义特征向量,另一块维数更小、又对 $T$ 不变,于是可以用归纳假设。

$n=\dim V=1$ 时显然。设 $n\gt1$。因为 $\mathbf{F}=\mathbf{C}$,$T$ 有特征值 $\lambda$(这里用到 ℂ;在 ℝ 上 $T$ 可能根本没有特征值)。对 $T-\lambda I$ 用 8.4: $$V=\operatorname{null}(T-\lambda I)^n\oplus\operatorname{range}(T-\lambda I)^n.$$ 前一块的非零向量都是对应 $\lambda$ 的广义特征向量;若它就是 $V$,结论已成立。否则,因 $\lambda$ 是特征值,前一块非零,故 $0\lt\dim\operatorname{range}(T-\lambda I)^n\lt n$。后一块对 $T$ 不变(5.18,取 $p(z)=(z-\lambda)^n$),对 $T$ 在它上面的限制用归纳假设,得到它的一组由广义特征向量组成的基。把两块的基拼起来即可。

在例 8.24 的算子上走一遍这个证明

取 $T(z_1,z_2,z_3)=(6z_1+3z_2+4z_3,\ 6z_2+2z_3,\ 7z_3)$(8B 的例 8.24)与特征值 $\lambda=6$。直接计算,$(T-6I)^3$ 的矩阵是 $\begin{pmatrix}0 & 0 & 10\\ 0 & 0 & 2\\ 0 & 0 & 1\end{pmatrix}$,所以 $$\operatorname{null}(T-6I)^3=\{(z_1,z_2,0)\},\qquad \operatorname{range}(T-6I)^3=\operatorname{span}\big((10,2,1)\big).$$ 前一块里的非零向量全是对应 6 的广义特征向量;后一块是一维不变子空间,$T$ 在上面就是乘以 7($T(10,2,1)=7\,(10,2,1)$),归纳立即结束。两块的基拼起来就是 $(1,0,0),\ (0,1,0),\ (10,2,1)$——正是例 8.24 给出的由广义特征向量组成的基。

ℝ 上不一定成立 若 $\mathbf{F}=\mathbf{R}$ 且 $\dim V\gt1$,有的算子有由广义特征向量组成的基,有的没有(例如 ℝ² 上的旋转 90°:它连一个特征值都没有)。习题 8A.11 给出了充要条件:极小多项式能分解成一次因式的乘积——这恰好也是「有上三角矩阵」的条件(5.44)。
例$\mathbf{C}^3$ 上算子的广义特征向量generalized eigenvectors of an operator on C³8.10

仍取 $T(z_1,z_2,z_3)=(4z_2,0,5z_3)$。它的特征值是 0 和 5:对应 0 的特征向量是形如 $(z_1,0,0)$ 的非零向量,对应 5 的是形如 $(0,0,z_3)$ 的非零向量——特征向量只张成一个平面,凑不满 $\mathbf{C}^3$。

广义特征向量呢?$T^3(z_1,z_2,z_3)=(0,0,125z_3)$,所以对应 0 的广义特征向量是形如 $(z_1,z_2,0)$ 的非零向量;$(T-5I)^3(z_1,z_2,z_3)=(-125z_1+300z_2,\ -125z_2,\ 0)$,所以对应 5 的广义特征向量是形如 $(0,0,z_3)$ 的非零向量。于是标准基的三个向量都是广义特征向量,正如 8.9 所保证。注意 $(0,1,0)$:$T(0,1,0)=(4,0,0)\neq0$,它不是特征向量,但 $T^2(0,1,0)=0$。

特征向量对应的特征值是唯一的($Tv=\lambda v$ 只能被一个 $\lambda$ 满足)。对广义特征向量,这一点并不显然,但同样成立:

命题广义特征向量只对应一个特征值generalized eigenvector corresponds to a unique eigenvalue8.11

设 $T\in\mathcal{L}(V)$。则 $T$ 的每个广义特征向量只对应 $T$ 的一个特征值。

证明思路

设 $v$ 同时对应 $\alpha$ 与 $\lambda$。取最小的正整数 $m$ 使 $(T-\alpha I)^m v=0$,于是 $w=(T-\alpha I)^{m-1}v\neq0$ 是 $\alpha$ 的特征向量。把 $T-\lambda I$ 写成 $(T-\alpha I)+(\alpha-\lambda)I$,按二项式展开: $$0=(T-\lambda I)^n v=\sum_{k=0}^{n}b_k(\alpha-\lambda)^{n-k}(T-\alpha I)^k v,\quad b_0=1.$$ 两边再作用 $(T-\alpha I)^{m-1}$:凡 $k\ge1$ 的项都变成 0,只剩 $0=(\alpha-\lambda)^n w$。因 $w\neq0$,得 $\alpha=\lambda$。

第 5 章证明过「不同特征值的特征向量线性无关」(5.11)。广义特征向量也有同样的性质,证明思路也几乎一样:

命题线性无关的广义特征向量linearly independent generalized eigenvectors8.12

设 $T\in\mathcal{L}(V)$。则 $T$ 的对应于互不相同特征值的广义特征向量组成的任何组都线性无关。

证明思路(最小反例)

设结论不成立,取长度 $m$ 最小的线性相关组 $v_1,\dots,v_m$(对应互异特征值 $\lambda_1,\dots,\lambda_m$),则 $a_1v_1+\cdots+a_mv_m=0$ 且所有 $a_k\neq0$(否则可以更短)。两边作用 $(T-\lambda_m I)^n$($n=\dim V$),$v_m$ 那一项消失:

$$a_1(T-\lambda_mI)^n v_1+\cdots+a_{m-1}(T-\lambda_mI)^n v_{m-1}=0.$$(8.13)

对 $k\lt m$,$(T-\lambda_mI)^n v_k\neq0$(否则 $v_k$ 同时对应 $\lambda_k$ 与 $\lambda_m$,与 8.11 矛盾);又因 $(T-\lambda_kI)^n$ 与 $(T-\lambda_mI)^n$ 可交换,$(T-\lambda_kI)^n\big((T-\lambda_mI)^n v_k\big)=0$,所以 $(T-\lambda_mI)^n v_k$ 仍是对应 $\lambda_k$ 的广义特征向量。于是 (8.13) 给出一个长度 $m-1$ 的线性相关组,与 $m$ 的最小性矛盾。

对剪切 $T(x,y)=(x+y,\ y)$(唯一特征值为 1),下列哪个向量是对应 1 的广义特征向量,但不是特征向量?

幂零算子 Nilpotent Operators

定义幂零nilpotent8.14

如果算子的某个幂等于 0,就称它是幂零的。

换句话说:$T$ 幂零 ⇔ $V$ 中每个非零向量都是 $T$ 的对应特征值 0 的广义特征向量。名字来自拉丁语:nil = 无、零,potens = 有力量——「某个幂为零」。

直觉:传送带 幂零算子像一条(或几条)传送带:每作用一次,所有东西往下挪一格,到了最底下就掉进 0。只要传送带有限长,挪够次数后一切都消失。在 8C 里我们会看到,这个「传送带」图像不仅是比喻——每个幂零算子都可以排成若干条这样的链(8.45)。
例幂零算子nilpotent operators8.15

(a) $\mathbf{F}^4$ 上的 $T(z_1,z_2,z_3,z_4)=(0,0,z_1,z_2)$ 是幂零的,因为 $T^2=0$(前两个坐标被搬到后两个位置,再搬一次就没了)。

(b) 以 $\begin{pmatrix}-3 & 9 & 0\\ -7 & 9 & 6\\ 4 & 0 & -6\end{pmatrix}$ 为(标准基下)矩阵的 $\mathbf{F}^3$ 上的算子是幂零的:把矩阵立方就得到零矩阵。(它的平方是秩 1 矩阵 $\begin{pmatrix}-54 & 54 & 54\\ -18 & 18 & 18\\ -36 & 36 & 36\end{pmatrix}$,还不是 0。)

(c) $\mathcal{P}_m(\mathbf{R})$ 上的求导算子 $D$ 是幂零的:次数不超过 $m$ 的多项式求 $m+1$ 阶导数得 0。注意这个空间的维数是 $m+1$,而 $D^m x^m=m!\neq0$,所以恰好要到 $m+1$ 次幂才变成 0——下面的 8.16 给出的上界在这里取到了。

反复施加幂零算子:向量一步步「掉进」0

选一个原书中的幂零算子,反复点「施加 T」。左侧柱状图是 $T^k v$ 的坐标(每一步自动缩放,柱上标出数值);右侧楼梯是 $\dim\operatorname{null}T^k$,圆点标出当前的 $k$。

无论 $v$ 怎么选,最多施加 $\dim V$ 次就全部变成 0(8.16);而有的算子提前很多就结束了——例 8.15(a) 只要 2 次。楼梯的形状(每一步零空间多几维)只取决于算子,与 $v$ 无关;它将在 Jordan 形中告诉我们「链」的长度。最后一个选项是反例:ℝ³ 上它唯一的实特征值是 0,但楼梯停在 1 维、永远到不了 $\dim V=3$,向量在 $z_2z_3$ 平面里转圈而不消失——这说明 8.17(b) 必须在 ℂ 上。

命题幂零算子的 dim V 次幂为 0nilpotent operator raised to dimension of domain is 08.16

设 $T\in\mathcal{L}(V)$ 幂零,则 $T^{\dim V}=0$。

证明

有某个 $k$ 使 $T^k=0$,即 $\operatorname{null}T^k=V$。零空间链最迟在 $\dim V$ 处停止增长(8.1、8.3),所以 $\operatorname{null}T^{\dim V}=V$,即 $T^{\dim V}=0$。(更精细的上界见习题 8A.18:$T^{1+\dim\operatorname{range}T}=0$。)

命题幂零算子的特征值eigenvalues of nilpotent operator8.17

设 $T\in\mathcal{L}(V)$。

(a) 若 $T$ 幂零,则 0 是 $T$ 的特征值,且 $T$ 没有别的特征值。

(b) 若 $\mathbf{F}=\mathbf{C}$ 且 0 是 $T$ 唯一的特征值,则 $T$ 幂零。

证明思路

(a) $T^m=0$ 说明 $T$ 不是单射,所以 0 是特征值。若 $Tv=\lambda v$($v\neq0$),反复作用得 $\lambda^m v=T^m v=0$,故 $\lambda=0$。

(b) 在 ℂ 上极小多项式的零点恰是全部特征值(5.27);唯一的零点是 0,所以极小多项式是 $z^m$,即 $T^m=0$。

常见误区:只有特征值 0 ≠ 幂零(在 ℝ 上) 8.17(b) 的「$\mathbf{F}=\mathbf{C}$」不能去掉(习题 8A.23)。例如 ℝ³ 上 $T(x,y,z)=(0,\,-z,\,y)$:它在 $yz$ 平面上是旋转 90°,没有实特征值,所以唯一的(实)特征值是 0;但 $T^4$ 在 $yz$ 平面上是恒等,$T$ 的任何幂都不是 0。

对一个算子,我们总想找一组基让矩阵尽量简单(尽量多 0)。对幂零算子,可以让矩阵的一大半都是 0:

定理幂零算子的极小多项式与上三角矩阵minimal polynomial and upper-triangular matrix of nilpotent operator8.18

设 $T\in\mathcal{L}(V)$。下列三条等价:

(a) $T$ 幂零; (b) $T$ 的极小多项式是 $z^m$($m$ 为某正整数); (c) 存在 $V$ 的一组基,使 $T$ 的矩阵形如 $$\begin{pmatrix}0 & & \ast\\ & \ddots & \\ 0 & & 0\end{pmatrix},$$ 即对角线及其下方全为 0(严格上三角)。

证明思路

(a)⇒(b):$T^n=0$,所以 $z^n$ 是极小多项式的倍式(5.29),极小多项式只能是 $z^m$。(b)⇒(c):0 是唯一特征值(5.27(a)),极小多项式可分解为一次因式,所以有上三角矩阵(5.44),且对角元都是特征值 0(5.41)。(c)⇒(a):严格上三角矩阵满足 $T^{\dim V}=0$(5.40)。

严格上三角 = 「只往前推」 矩阵严格上三角,意思是 $Tv_k\in\operatorname{span}(v_1,\dots,v_{k-1})$:每个基向量都被推向「更靠前」的基向量。于是 $T$ 把 $\operatorname{span}(v_1,\dots,v_k)$ 推进 $\operatorname{span}(v_1,\dots,v_{k-1})$,推 $n$ 次后什么都不剩。后面的 Jordan 形会做得更好:让每个基向量恰好被推到前一个基向量(或 0)。

在 ℝ³ 上,若算子 $T$ 唯一的特征值是 0,$T$ 一定是幂零的吗?

本节要点
  • $\operatorname{null}T^k$ 随 $k$ 递增,一旦持平就永远持平,最迟第 $\dim V$ 步持平;此时 $V=\operatorname{null}T^n\oplus\operatorname{range}T^n$。
  • 广义特征向量:$(T-\lambda I)^k v=0$(等价于 $k=\dim V$);在 ℂ 上它们能组成基(8.9),且不同特征值的广义特征向量线性无关(8.12)。
  • 幂零 ⇔ 极小多项式为 $z^m$ ⇔ 有严格上三角矩阵;幂零算子的 $\dim V$ 次幂一定为 0。
广义特征向量generalized eigenvector非零向量 $v$,满足 $(T-\lambda I)^k v=0$ 对某个正整数 $k$ 成立(等价地 $k=\dim V$)。特征向量是 $k=1$ 的特例。
幂零算子nilpotent operator某个幂等于 0 的算子;必有 $T^{\dim V}=0$,唯一的特征值是 0。
特征空间分解eigenspace decomposition$V=E(\lambda_1,T)\oplus\cdots\oplus E(\lambda_m,T)$;成立 ⇔ $T$ 可对角化(5.55)。

8B 广义特征空间分解 Generalized Eigenspace Decomposition

这一节把 8A 的零件拼成本章的核心定理:在 ℂ 上,$V$ 恰好是各个广义特征空间的直和,而 $T$ 在每一块上都是「$\lambda I$ + 幂零」。由此自然地得到重数、特征多项式、Cayley–Hamilton 定理,以及「分块对角 + 上三角块」的矩阵。

广义特征空间 Generalized Eigenspaces

定义广义特征空间 $G(\lambda,T)$generalized eigenspace8.19

设 $T\in\mathcal{L}(V)$,$\lambda\in\mathbf{F}$。$T$ 对应于 $\lambda$ 的广义特征空间定义为 $$G(\lambda,T)=\{v\in V:\ (T-\lambda I)^k v=0\ \text{对某个正整数}\ k\}.$$

也就是:对应 $\lambda$ 的全部广义特征向量,再加上 0 向量。每个特征向量都是广义特征向量(取 $k=1$),所以特征空间包含在广义特征空间里:$E(\lambda,T)\subseteq G(\lambda,T)$。(若 $\lambda$ 不是特征值,则两者都是 $\{0\}$。)

命题广义特征空间的刻画description of generalized eigenspaces8.20

设 $T\in\mathcal{L}(V)$,$\lambda\in\mathbf{F}$。则 $G(\lambda,T)=\operatorname{null}(T-\lambda I)^{\dim V}$。特别地,$G(\lambda,T)$ 是 $V$ 的子空间。

证明

「⊇」由定义显然。「⊆」:若 $v\in\operatorname{null}(T-\lambda I)^k$,对 $T-\lambda I$ 用 8.1、8.3,得 $v\in\operatorname{null}(T-\lambda I)^{\dim V}$。

例$\mathbf{C}^3$ 上算子的广义特征空间generalized eigenspaces of an operator on C³8.21

对 $T(z_1,z_2,z_3)=(4z_2,0,5z_3)$(例 8.10),$G(0,T)=\{(z_1,z_2,0)\}$,$G(5,T)=\{(0,0,z_3)\}$。注意 $\mathbf{C}^3=G(0,T)\oplus G(5,T)$——在前面的 3D 演示中选「例 8.6」并取 $k\ge2$,看到的蓝色平面与橙色直线正是这两个广义特征空间。

例 8.21 中 $V$ 恰好是广义特征空间的直和。下面的主定理说:在 ℂ 上这总是对的。

定理广义特征空间分解generalized eigenspace decomposition8.22

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的全部互异特征值。则

(a) 每个 $G(\lambda_k,T)$ 都在 $T$ 下不变;
(b) 每个 $(T-\lambda_k I)|_{G(\lambda_k,T)}$ 都是幂零的;
(c) $V=G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T)$。

证明思路

(a) $G(\lambda_k,T)=\operatorname{null}(T-\lambda_kI)^{\dim V}$(8.20),而多项式 $p(T)$ 的零空间总在 $T$ 下不变(5.18)。

(b) 对 $v\in G(\lambda_k,T)$ 有 $(T-\lambda_kI)^{\dim V}v=0$,所以限制在 $G(\lambda_k,T)$ 上的 $T-\lambda_kI$ 的 $\dim V$ 次幂为 0。

(c) 是直和:若 $v_1+\cdots+v_m=0$,$v_k\in G(\lambda_k,T)$,由 8.12(不同特征值的广义特征向量线性无关)每个 $v_k=0$(1.45)。凑得满:由 8.9,$V$ 有由广义特征向量组成的基,每个基向量都落在某个 $G(\lambda_k,T)$ 中。

广义特征空间分解的示意:$V$ 被分成若干个「房间」$G(\lambda_k,T)$。$T$ 从不把向量搬出房间(不变性);在房间内部,$T=\lambda_k I+N_k$,其中 $N_k$ 幂零——点与箭头表示 $N_k$ 把向量沿链往下推,最终推到 0。
直觉:分房间,各管各的 8.22 把「研究一个复杂算子」化成了「分别研究若干个简单算子」:在每个房间里,$T$ 只做两件事——整体乘以 $\lambda_k$,再加上一个「迟早会消失的漂移」$N_k$。对角化的情形就是所有漂移都恰好为 0(每个房间里 $T=\lambda_k I$)。非对角化的情形,毛病全部集中在漂移上,而漂移(幂零算子)的结构在 8C 会被彻底弄清楚。

在 ℝ 上,$V$ 是广义特征空间的直和当且仅当极小多项式能分解成一次因式的乘积(习题 8B.8)。

特征值的重数 Multiplicity of an Eigenvalue

分解中各块的维数重要到值得起个名字:

定义重数multiplicity8.23

设 $T\in\mathcal{L}(V)$,$\lambda$ 是 $T$ 的特征值。$\lambda$ 的重数定义为对应的广义特征空间的维数 $\dim G(\lambda,T)$;换句话说(由 8.20),重数 $=\dim\operatorname{null}(T-\lambda I)^{\dim V}$。

例算子各特征值的重数multiplicity of each eigenvalue of an operator8.24

设 $T\in\mathcal{L}(\mathbf{C}^3)$,$T(z_1,z_2,z_3)=(6z_1+3z_2+4z_3,\ 6z_2+2z_3,\ 7z_3)$,标准基下的矩阵是 $$\begin{pmatrix}6 & 3 & 4\\ 0 & 6 & 2\\ 0 & 0 & 7\end{pmatrix}.$$ 特征值是对角元 6 和 7(5.41)。可以验证 $$G(6,T)=\operatorname{span}\big((1,0,0),(0,1,0)\big),\qquad G(7,T)=\operatorname{span}\big((10,2,1)\big).$$ 所以 6 的重数是 2,7 的重数是 1——恰好等于它们在这个上三角矩阵对角线上出现的次数(这不是巧合,见 8.31)。$\mathbf{C}^3=G(6,T)\oplus G(7,T)$ 就是 8.22 承诺的分解;$(1,0,0),(0,1,0),(10,2,1)$ 是 8.9 承诺的由广义特征向量组成的基。但 $E(6,T)$ 只是一条直线 $\operatorname{span}((1,0,0))$,所以不存在由特征向量组成的基。

广义特征空间分解与分块对角化(ℝ³ 中的 3D 图)

左图(按住拖动可旋转):半透明平面 / 粗线 = 广义特征空间 $G(\lambda,T)$,细实线 = 特征空间 $E(\lambda,T)$。滑块 $t$ 把标准基逐渐换成由广义特征向量组成的基 $b_1,b_2,b_3$;右图是 $T$ 在当前基下的矩阵,看虚线框外的数在 $t=1$ 时全部变成 0。(为看清,例 8.24 的坐标轴按不同比例显示——本章不涉及长度与角度,子空间关系不变。)

在例 8.24 中,$G(6,T)$ 是整个平面而 $E(6,T)$ 只是其中一条线:特征向量只占了这个房间的一个维度,另一个维度靠广义特征向量 $(0,1,0)$ 补上(重数 2 > 几何重数 1)。把「3 改成 0」后,$E(6,T)$ 胀满整个平面,算子变成可对角化的。每个例子中 $v$ 都被唯一地拆成各房间里的分量之和;$t$ 拖到 1 时矩阵变为分块对角——这就是后面的 8.37 与例 8.38。

命题重数之和等于 dim Vsum of the multiplicities equals dim V8.25

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 $T$ 所有特征值的重数之和等于 $\dim V$。

证明

由广义特征空间分解 8.22 和直和的维数公式(3.94):$\dim V=\dim G(\lambda_1,T)+\cdots+\dim G(\lambda_m,T)$。

有些书用代数重数(algebraic multiplicity)与几何重数(geometric multiplicity)两个词。本书的「重数」就是代数重数:

代数重数(= 本书的重数)几何重数
定义$\dim G(\lambda,T)=\dim\operatorname{null}(T-\lambda I)^{\dim V}$$\dim E(\lambda,T)=\dim\operatorname{null}(T-\lambda I)$
直观「房间」的大小房间里真正的特征方向有多少维
在上三角矩阵里$\lambda$ 在对角线上出现的次数(8.31)—
在 Jordan 形里(8C)所有 $\lambda$-块的大小之和$\lambda$-块的个数
例 8.24 的 $\lambda=6$21

因为 $E(\lambda,T)\subseteq G(\lambda,T)$,总有几何重数 ≤ 代数重数。在 ℂ 上,由 5.55 与 8.25,$T$ 可对角化 ⇔ 每个特征值的两种重数都相等。注意:代数重数虽然名字里有「代数」,按本书的定义它同样有几何意义(某个零空间的维数);传统上用行列式定义它,第 9 章的 9.62 会说明两种定义一致。正规算子的两种重数总相等(对 $T-\lambda I$ 用 7A 的习题 27)。

定义特征多项式characteristic polynomial8.26

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的互异特征值,重数分别为 $d_1,\dots,d_m$。多项式 $$(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}$$ 称为 $T$ 的特征多项式。

8.27 例:例 8.24 中的算子的特征多项式是 $(z-6)^2(z-7)$。

命题特征多项式的次数与零点degree and zeros of characteristic polynomial8.28

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 (a) $T$ 的特征多项式的次数为 $\dim V$;(b) 它的零点恰是 $T$ 的特征值。

(a) 就是 8.25;(b) 由定义直接得到。

大多数教材用行列式 $\det(zI-T)$ 定义特征多项式(两种定义等价,见 9.62)。本书的定义简单得多,而且直接给出 Cayley–Hamilton 定理的一个漂亮证明:

定理Cayley–Hamilton 定理Cayley–Hamilton theorem8.29

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$q$ 是 $T$ 的特征多项式。则 $q(T)=0$。

证明思路:每个房间一把钥匙

记 $d_k=\dim G(\lambda_k,T)$。由 8.22(b),$(T-\lambda_kI)|_{G(\lambda_k,T)}$ 幂零,而幂零算子的「维数次幂」为 0(8.16),所以 $(T-\lambda_kI)^{d_k}$ 把整个房间 $G(\lambda_k,T)$ 清空。

$q(T)=(T-\lambda_1I)^{d_1}\cdots(T-\lambda_mI)^{d_m}$ 的各因子可交换,所以对第 $k$ 个房间,可以把因子 $(T-\lambda_kI)^{d_k}$ 挪到最右边先作用——房间被清空,于是 $q(T)|_{G(\lambda_k,T)}=0$。每个向量都是各房间中向量之和(8.22),所以 $q(T)=0$。

验算例 8.24 $q(z)=(z-6)^2(z-7)$。直接计算得 $(T-6I)(T-7I)=\begin{pmatrix}0 & -3 & 6\\ 0 & 0 & 0\\ 0 & 0 & 0\end{pmatrix}\neq0$,再乘一个 $T-6I$ 才变成 0 矩阵:$(T-6I)^2(T-7I)=0$。所以这个算子的极小多项式就是 $(z-6)^2(z-7)$,与特征多项式相同。
Cayley–Hamilton 的几何图像:$T^2v$ 总由 $Tv$ 与 $v$ 按固定系数拼成

2×2 情形:设特征值(按重数)为 $\lambda_1,\lambda_2$,特征多项式 $q(z)=z^2-(\lambda_1+\lambda_2)z+\lambda_1\lambda_2$。$q(T)=0$ 的意思是:对每个向量 $v$,$T^2v=(\lambda_1+\lambda_2)\,Tv-\lambda_1\lambda_2\,v$。拖动紫色的 $v$:浅蓝箭头 $(\lambda_1+\lambda_2)Tv$ 接上浅紫箭头 $-\lambda_1\lambda_2v$,看终点是否落在绿色的 $T^2v$ 上。

无论 $v$ 指向哪里,两段箭头的终点都精确地落在 $T^2v$ 上:系数 $\lambda_1+\lambda_2$ 与 $\lambda_1\lambda_2$ 只由 $T$ 决定、与 $v$ 无关——这正是「$q(T)$ 是零算子」。剪切:$T^2v=2Tv-v$;旋转 90°:$T^2v=-v$(转两次 = 反向);幂零:$T^2v=0$。

历史注记(原书页边注与本章首页图注):Hamilton 在 1853 年证明了这个定理的一个特例;Cayley(1821–1895)在本科毕业前就发表了三篇数学论文。

推论特征多项式是极小多项式的倍式characteristic polynomial is a multiple of minimal polynomial8.30

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 $T$ 的特征多项式是 $T$ 的极小多项式的多项式倍式。

由 Cayley–Hamilton 与 5.29($q(T)=0$ ⇔ $q$ 是极小多项式的倍式)立得。由此,若极小多项式的次数是 $\dim V$(「几乎总是」如此,见 5.24 之后的讨论),则两者相等。

常见误区
  • 「特征多项式就是极小多项式」✗:两者的零点相同(都恰是全部特征值),但指数可以不同——特征多项式中的指数是代数重数(房间的大小),极小多项式中的指数是最长的链的长度(见 8C)。例如 $n$ 维空间上的恒等算子:特征多项式 $(z-1)^n$,极小多项式 $z-1$。
  • 「重数 = 特征空间的维数」✗:本书的重数是 $\dim G(\lambda,T)$,它可能大于 $\dim E(\lambda,T)$(例 8.24 中 $2\gt1$)。

现在可以证明例 8.24 暗示的规律:

定理重数 = 在对角线上出现的次数multiplicity of an eigenvalue equals number of times on diagonal8.31

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$T$ 关于基 $v_1,\dots,v_n$ 的矩阵是上三角的。则每个特征值 $\lambda$ 在对角线上出现的次数等于 $\lambda$ 的重数。

证明思路:先证「≤」,再用求和逼出「=」

设对角元是 $\lambda_1,\dots,\lambda_n$,其中恰有 $d$ 个为 0。上三角意味着 $Tv_k=u_k+\lambda_kv_k$,$u_k\in\operatorname{span}(v_1,\dots,v_{k-1})$。若 $\lambda_k\neq0$,则 $Tv_k$ 不是 $Tv_1,\dots,Tv_{k-1}$ 的线性组合(它在 $v_k$ 方向上有分量),由线性相关性引理(2.19),这些 $Tv_k$ 线性无关,故 $\dim\operatorname{range}T\ge n-d$,即

$$\dim\operatorname{null}T\le d.$$(8.32)

$T^n$ 的矩阵是上三角的 $A^n$,对角元 $\lambda_k^n$,其中 0 的个数仍是 $d$;对 $T^n$ 用 (8.32) 得 $\dim\operatorname{null}T^n\le d$ 8.33。再把 $T$ 换成 $T-\lambda I$:$\lambda$ 的重数 $m_\lambda\le$ $\lambda$ 在对角线上出现的次数 $d_\lambda$ 8.34。对所有特征值求和,左边 $=n$(8.25),右边也 $=n$(对角线长 $n$),所以每个不等式都必须取等号。

算子 $\begin{pmatrix}6 & 3 & 4\\ 0 & 6 & 2\\ 0 & 0 & 7\end{pmatrix}$ 的特征值 6 的(代数)重数与几何重数分别是多少?

分块对角矩阵 Block Diagonal Matrices

为了用矩阵语言表达上面的结论,推广「对角矩阵」的概念——把一个大矩阵看成由若干小矩阵拼成,往往更容易理解。

定义分块对角矩阵block diagonal matrix8.35

分块对角矩阵是形如 $$\begin{pmatrix}A_1 & & 0\\ & \ddots & \\ 0 & & A_m\end{pmatrix}$$ 的方阵,其中 $A_1,\dots,A_m$ 是沿对角线排列的方阵,其余元素全为 0。若每个 $A_k$ 都是 1×1 的,就是普通的对角矩阵。

对应原书例 8.36:5×5 矩阵 $A$ 由三个对角块 $A_1=(4)$、$A_2=\begin{pmatrix}2 & -3\\ 0 & 2\end{pmatrix}$、$A_3=\begin{pmatrix}1 & 7\\ 0 & 1\end{pmatrix}$ 组成,块外全是 0。

例 8.36 中每个块都是上三角的,而且对角元全相同。下一个定理说:在 ℂ 上,每个算子都有这种形状的矩阵——比上三角多了大量的 0。

定理上三角块组成的分块对角矩阵block diagonal matrix with upper-triangular blocks8.37

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的互异特征值,重数为 $d_1,\dots,d_m$。则存在 $V$ 的一组基,使 $T$ 的矩阵是分块对角矩阵 $\operatorname{diag}(A_1,\dots,A_m)$,其中每个 $A_k$ 是 $d_k\times d_k$ 的上三角矩阵 $$A_k=\begin{pmatrix}\lambda_k & & \ast\\ & \ddots & \\ 0 & & \lambda_k\end{pmatrix}.$$

证明思路

每个 $(T-\lambda_kI)|_{G(\lambda_k,T)}$ 幂零(8.22),按 8.18(c) 给 $G(\lambda_k,T)$ 选一组基使它的矩阵严格上三角。于是 $T|_{G(\lambda_k,T)}=(T-\lambda_kI)|_{G(\lambda_k,T)}+\lambda_kI$ 的矩阵就是对角线全为 $\lambda_k$ 的上三角矩阵 $A_k$。把各房间的基拼起来(8.22(c) 保证它是 $V$ 的基),由于每个房间都不变,矩阵在块外全是 0。

例用广义特征向量得到分块对角矩阵block diagonal matrix via generalized eigenvectors8.38

仍取例 8.24 的 $T$,标准基下的矩阵 $\begin{pmatrix}6 & 3 & 4\\ 0 & 6 & 2\\ 0 & 0 & 7\end{pmatrix}$ 是上三角的,但还不是 8.37 的形状。改用由广义特征向量组成的基 $(1,0,0),(0,1,0),(10,2,1)$,矩阵变成 $$\begin{pmatrix}6 & 3 & 0\\ 0 & 6 & 0\\ 0 & 0 & 7\end{pmatrix}=\operatorname{diag}\left(\begin{pmatrix}6 & 3\\ 0 & 6\end{pmatrix},\ (7)\right).$$ 在上面的 3D 演示中选第一个例子,把 $t$ 从 0 拖到 1:第三个基向量从 $(0,0,1)$ 滑向 $(10,2,1)$,右上角的 4 和 2 同步地线性缩小为 $4(1-t)$、$2(1-t)$,在 $t=1$ 时消失。

再进一步(预告 8C):在房间 $G(6,T)$ 里把基换成一条链:$(T-6I)(0,1,0)=(3,0,0)$,而 $(T-6I)(3,0,0)=0$。于是 $(3,0,0),\ (0,1,0),\ (10,2,1)$ 下的矩阵是 $\begin{pmatrix}6 & 1 & 0\\ 0 & 6 & 0\\ 0 & 0 & 7\end{pmatrix}$——上三角块里的 3 也变成了 1,这就是 Jordan 形。

分块对角矩阵按块相乘 两个分块方式相同的分块对角矩阵相乘,只需各块分别相乘:$\operatorname{diag}(A_1,\dots,A_m)\operatorname{diag}(B_1,\dots,B_m)=\operatorname{diag}(A_1B_1,\dots,A_mB_m)$(习题 8B.22)。所以 $T$ 的幂、$T$ 的多项式都「逐块」计算——这正是「分房间,各管各的」在矩阵上的体现。
本节要点
  • $G(\lambda,T)=\operatorname{null}(T-\lambda I)^{\dim V}\supseteq E(\lambda,T)$。
  • 在 ℂ 上:$V=\bigoplus_k G(\lambda_k,T)$,每块不变,且在每块上 $T=\lambda_kI+$ 幂零(8.22)。
  • 重数(代数重数)$=\dim G(\lambda,T)$,总和为 $\dim V$,等于 $\lambda$ 在任何上三角矩阵对角线上出现的次数;几何重数 $=\dim E(\lambda,T)$,不超过代数重数。
  • 特征多项式 $\prod(z-\lambda_k)^{d_k}$;Cayley–Hamilton:$q(T)=0$,所以它是极小多项式的倍式。
  • 矩阵形式:分块对角,每块是对角线全为 $\lambda_k$ 的上三角矩阵(8.37)。
广义特征空间generalized eigenspace$G(\lambda,T)=\{v:(T-\lambda I)^k v=0\ \text{对某个}\ k\}=\operatorname{null}(T-\lambda I)^{\dim V}$。
重数multiplicity特征值 $\lambda$ 的重数 $=\dim G(\lambda,T)$;在 ℂ 上所有重数之和为 $\dim V$。
代数重数algebraic multiplicity即本书的「重数」$\dim G(\lambda,T)$;等于 $\lambda$ 在上三角矩阵对角线上出现的次数。
几何重数geometric multiplicity$\dim E(\lambda,T)=\dim\operatorname{null}(T-\lambda I)$,不超过代数重数。
特征多项式characteristic polynomial$\mathbf{F}=\mathbf{C}$ 时 $(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}$,$d_k$ 为重数;次数 $=\dim V$。
Cayley–Hamilton 定理Cayley–Hamilton theorem设 $q$ 是 $T$ 的特征多项式,则 $q(T)=0$(ℂ 上,8.29)。
分块对角矩阵block diagonal matrix沿对角线排着若干方阵 $A_1,\dots,A_m$、其余元素全为 0 的方阵。

8C 广义特征空间分解的推论 Consequences of Generalized Eigenspace Decomposition

8.22 让我们可以「分而治之」:只要会处理「$\lambda I$ + 幂零」这种简单情形,再把各个房间拼起来即可。这一节给出两个重要应用:可逆算子的平方根,以及把矩阵化到几乎最简的 Jordan 标准形。

算子的平方根 Square Roots of Operators

回忆 7.36:若 $R^2=T$,就称 $R$ 是 $T$ 的平方根(square root)。每个复数都有平方根,但不是每个复向量空间上的算子都有平方根:例如 $\mathbf{C}^3$ 上的 $T(z_1,z_2,z_3)=(z_2,z_3,0)$ 就没有(习题 8C.1,见本章习题)。这个 $T$ 不可逆,这并非偶然——我们马上会看到,可逆算子在 ℂ 上总有平方根。先从「单位 + 幂零」开始。

引理单位加幂零有平方根identity plus nilpotent has a square root8.39

设 $T\in\mathcal{L}(V)$ 幂零,则 $I+T$ 有平方根。

证明思路:把泰勒级数「截断」

回忆 $\sqrt{1+x}$ 的泰勒级数

$$\sqrt{1+x}=1+a_1x+a_2x^2+\cdots\qquad\Big(a_1=\tfrac12,\ a_2=-\tfrac18,\ a_3=\tfrac1{16},\ \dots\Big)$$(8.40)

($a_1=\frac12$ 说明 $x$ 很小时 $\sqrt{1+x}\approx1+\frac x2$。这里只把级数当作灵感,不关心收敛。)设 $T^m=0$。把 $x$ 换成 $T$、1 换成 $I$,无穷级数自动变成有限和,于是猜测平方根形如 $R=I+a_1T+a_2T^2+\cdots+a_{m-1}T^{m-1}$。平方后按 $T$ 的幂整理: $$R^2=I+2a_1T+(2a_2+a_1^2)T^2+(2a_3+2a_1a_2)T^3+\cdots+\big(2a_{m-1}+\text{含 }a_1,\dots,a_{m-2}\text{ 的项}\big)T^{m-1}.$$ 要让它等于 $I+T$:取 $2a_1=1$,得 $a_1=\frac12$;再令 $T^2$ 的系数 $2a_2+a_1^2=0$,得 $a_2=-\frac18$;再令 $T^3$ 的系数为 0,得 $a_3=\frac1{16}$;依此类推,每一步都只需解一个关于新系数的一次方程。我们甚至不需要系数的通项公式,只需要知道它们能这样依次选出来。

令 $R^2$ 中……的系数$T^1$ 的系数 = 1$T^2$ 的系数 = 0$T^3$ 的系数 = 0$T^4$ 的系数 = 0
方程$2a_1=1$$2a_2+a_1^2=0$$2a_3+2a_1a_2=0$$2a_4+2a_1a_3+a_2^2=0$
解$a_1=\frac12$$a_2=-\frac18$$a_3=\frac1{16}$$a_4=-\frac5{128}$

8.39 在 ℝ 和 ℂ 上都成立;但下面的定理只在 ℂ 上成立——比如一维实空间 ℝ 上「乘以 −1」就没有平方根。证明中要用到「每个复数都有平方根」:

对应原书 8C 的页边图「复数的极坐标表示」:$z=r(\cos\theta+i\sin\theta)$,其中 $r$ 是原点到 $z$ 的线段长,$\theta$ 是它与正实轴的夹角。那么 $\sqrt r\big(\cos\frac\theta2+i\sin\frac\theta2\big)$ 就是 $z$ 的一个平方根:模开方、辐角减半(图中绿色点)。
定理在 ℂ 上可逆算子有平方根over C, invertible operators have square roots8.41

设 $V$ 是复向量空间,$T\in\mathcal{L}(V)$ 可逆。则 $T$ 有平方根。

证明思路:逐个房间开方,再拼起来

设 $\lambda_1,\dots,\lambda_m$ 是互异特征值。由 8.22(b),在每个房间上 $T|_{G(\lambda_k,T)}=\lambda_kI+T_k$,$T_k$ 幂零。$T$ 可逆,所以没有 $\lambda_k=0$,可以写 $$T|_{G(\lambda_k,T)}=\lambda_k\Big(I+\frac{T_k}{\lambda_k}\Big).$$ $T_k/\lambda_k$ 仍幂零,由 8.39,$I+T_k/\lambda_k$ 有平方根;再乘以复数 $\lambda_k$ 的一个平方根,就得到 $T|_{G(\lambda_k,T)}$ 的平方根 $R_k$。最后,每个 $v$ 唯一地写成 $v=u_1+\cdots+u_m$($u_k\in G(\lambda_k,T)$),定义 $Rv=R_1u_1+\cdots+R_mu_m$,容易验证 $R^2=T$。

为什么需要「可逆」和「ℂ」 可逆保证每个 $\lambda_k\neq0$,才能提出因子 $\lambda_k$,把房间里的算子写成「数 × (单位 + 幂零)」;若 $\lambda_k=0$,房间里只剩幂零部分,而幂零算子可能没有平方根(如 $(z_2,z_3,0)$)。ℂ 保证两件事:特征值存在(从而有分解 8.22),以及每个 $\lambda_k$ 都能开平方。同样的方法可以证明:ℂ 上的可逆算子对每个正整数 $k$ 都有 $k$ 次方根。
给 2×2 Jordan 块开平方:R 作用两次 = T

$T=\begin{pmatrix}\lambda & 1\\ 0 & \lambda\end{pmatrix}=\lambda\big(I+\tfrac1\lambda N\big)$,其中 $N=\begin{pmatrix}0 & 1\\ 0 & 0\end{pmatrix}$,$N^2=0$,所以泰勒级数只需两项:$R=\sqrt\lambda\big(I+\tfrac{1}{2\lambda}N\big)$。图中灰框是单位正方形,绿色是它在 $R$ 下的像,蓝色是再作用一次 $R$ 的像,红色虚线是 $T$ 的像。拖动 $\lambda$,切换级数项数,看蓝色是否与红色虚线重合。

取两项时,蓝色平行四边形与红色虚线完全重合:$R^2=T$ 精确成立,因为 $N^2=0$ 让级数在第二项后「截断」;只取一项($\sqrt\lambda I$)时右上角的 1 丢失了。$-R$ 也是平方根——平方根并不唯一。把 $\lambda$ 拖向 0:$R$ 右上角的 $\frac{1}{2\sqrt\lambda}$ 越来越大,$\lambda=0$ 时 $T=N$ 根本没有平方根(若 $R^2=N$,则 $R$ 幂零,于是 $R^2=0$,矛盾)——这就是 8.41 要求可逆的原因。

下列哪一类 $\mathbf{C}^3$ 上的算子一定有平方根?

Jordan 标准形 Jordan Form

8.37 已经给了一个很好的上三角矩阵。还能更好:存在一组基,使矩阵除了对角线和紧挨对角线上方的那条线外全是 0。先看两个幂零算子的例子。

例有漂亮矩阵的幂零算子nilpotent operator with nice matrix8.42

$\mathbf{C}^4$ 上 $T(z_1,z_2,z_3,z_4)=(0,z_1,z_2,z_3)$ 满足 $T^4=0$。取 $v=(1,0,0,0)$,则 $T^3v,\ T^2v,\ Tv,\ v$ 是 $\mathbf{C}^4$ 的一组基——它是一条长度为 4 的链。$T$ 关于这组基的矩阵是 $$\begin{pmatrix}0 & 1 & 0 & 0\\ 0 & 0 & 1 & 0\\ 0 & 0 & 0 & 1\\ 0 & 0 & 0 & 0\end{pmatrix}.$$

例矩阵稍复杂一点的幂零算子nilpotent operator with slightly more complicated matrix8.43

$\mathbf{C}^6$ 上 $T(z_1,\dots,z_6)=(0,z_1,z_2,0,z_4,0)$ 满足 $T^3=0$。这次不存在 $v$ 使 $T^5v,\dots,Tv,v$ 成为基($T^3=0$,一条链最长只有 3)。但取 $v_1=e_1$,$v_2=e_4$,$v_3=e_6$,则 $T^2v_1,Tv_1,v_1,Tv_2,v_2,v_3$ 是基,矩阵是由 3×3、2×2、1×1 三个块组成的分块对角矩阵,每块对角线上方是 1、其余是 0。下面的步骤播放器一步步把「链」变成矩阵。

第 1 步:看 T 对标准基做了什么

$T(z_1,\dots,z_6)=(0,z_1,z_2,0,z_4,0)$,所以 $e_1\mapsto e_2\mapsto e_3\mapsto0$,$e_4\mapsto e_5\mapsto0$,$e_6\mapsto0$。下图把每个基向量画成一个点,向下的箭头表示「作用一次 $T$」。

第 2 步:第一条链

取 $v_1=e_1$:$v_1\to Tv_1=e_2\to T^2v_1=e_3\to0$,链长 3。链底的 $T^2v_1$ 一步就被送到 0——它是特征向量;链上其他点是广义特征向量。

第 3 步:另外两条链

取 $v_2=e_4$:$v_2\to Tv_2=e_5\to0$(链长 2);取 $v_3=e_6$:$v_3\to0$(链长 1)。三条链上的点合起来恰好是 $\mathbf{C}^6$ 的一组基。

第 4 步:从链底往上,依次编号成基

基的顺序:$T^2v_1,\ Tv_1,\ v_1,\ Tv_2,\ v_2,\ v_3$(图中点上的编号 1–6)。每条链先写链底的特征向量,再往上写。

第 5 步:逐列写出矩阵

第 $j$ 列 = 第 $j$ 个基向量的像的坐标。$T$ 把每个点往下推一格,推到的恰好是编号少 1 的那个基向量,所以第 $j$ 列只在第 $j-1$ 行有一个 1;链底的点被送到 0,对应的列(第 1、4、6 列)全为 0。

第 6 步:每条链 = 一个 Jordan 块

矩阵分块对角:3×3、2×2、1×1 三块,每块对角线是 0、紧挨对角线上方是 1。块数 = 链数 = 链底点数 = $\dim\operatorname{null}T=3$;最长的链长 3,所以 $T^3=0$ 而 $T^2\neq0$。

一般地,我们希望每个幂零算子 $T$ 都像例 8.43 那样:存在向量 $v_1,\dots,v_n$,使形如 $T^jv_k$ 的向量组成基($k$ 从 1 到 $n$,$j$ 倒序地从最大的 $m_k$(满足 $T^{m_k}v_k\neq0$)取到 0),这时矩阵由若干个「只在对角线上方有 1」的块组成。对一般算子,块的对角线换成特征值:

定义Jordan 基Jordan basis8.44

设 $T\in\mathcal{L}(V)$。若 $T$ 关于 $V$ 的某组基的矩阵是分块对角矩阵 $\operatorname{diag}(A_1,\dots,A_p)$,其中每个 $A_k$ 形如 $$A_k=\begin{pmatrix}\lambda_k & 1 & & 0\\ & \ddots & \ddots & \\ & & \ddots & 1\\ 0 & & & \lambda_k\end{pmatrix},$$ 就称这组基是 $T$ 的Jordan 基。这样的 $A_k$ 常称为 Jordan 块(Jordan block)。

  • 每个 $\lambda_k$ 都是 $T$ 的特征值(上三角矩阵的对角元,5.41);不同的块可以有相同的 $\lambda_k$。
  • $A_k$ 可以是 1×1 的 $(\lambda_k)$。所有块都是 1×1 ⇔ 矩阵是对角的。
  • 若 $T$ 幂零,所有 $\lambda_k=0$,这正是前面描述的「链」的情形。

证明「每个算子都有 Jordan 基」的主要工作在于幂零的特殊情形——而它在实向量空间上同样成立:

定理每个幂零算子都有 Jordan 基every nilpotent operator has a Jordan basis8.45

设 $T\in\mathcal{L}(V)$ 幂零,则 $V$ 有一组基是 $T$ 的 Jordan 基。

证明思路:先拿出最长的链,再找一个不变的补空间

策略:对 $\dim V$ 归纳。设 $m$ 是使 $T^m=0$ 的最小正整数,取 $u$ 使 $T^{m-1}u\neq0$。最长的链 $u,Tu,\dots,T^{m-1}u$ 线性无关(习题 8A.2),张成 $U$,它对 $T$ 不变。若 $U=V$,把这条链倒序排列就是 Jordan 基。否则,只要找到一个也对 $T$ 不变的子空间 $W$ 使 $V=U\oplus W$,就可以对 $W$(维数更小)用归纳假设,再把两部分的 Jordan 基拼起来。

构造 $W$:取线性泛函 $\varphi\in V'$ 使 $\varphi(T^{m-1}u)\neq0$,令 $$W=\{v\in V:\ \varphi(T^kv)=0,\ k=0,\dots,m-1\}.$$ 它对 $T$ 不变($k=m-1$ 的情形用到 $T^m=0$)。

$U\cap W=\{0\}$:设 $0\neq v=c_0u+c_1Tu+\cdots+c_{m-1}T^{m-1}u\in U$,$j$ 是使 $c_j\neq0$ 的最小下标。作用 $T^{m-j-1}$ 得 $T^{m-j-1}v=c_jT^{m-1}u$,于是 $\varphi(T^{m-j-1}v)=c_j\varphi(T^{m-1}u)\neq0$,所以 $v\notin W$。

维数凑满:定义 $S:V\to\mathbf{F}^m$,$Sv=(\varphi(v),\varphi(Tv),\dots,\varphi(T^{m-1}v))$,则 $W=\operatorname{null}S$,$\dim W\ge\dim V-m$,于是 $\dim(U\oplus W)\ge m+(\dim V-m)=\dim V$。

这个证明里最巧妙的一步是「补空间 $W$」的构造。下面用一个具体的 3 维例子把它走一遍——你会看到,随手挑的补空间通常不是不变的,而用线性泛函 $\varphi$ 造出的 $W$ 恰好是。(图可按住拖动旋转。)

第 1 步:一个具体的幂零算子

在 $\mathbf{F}^3$ 上取 $T(z_1,z_2,z_3)=(z_2+z_3,\ 0,\ 0)$:$Te_1=0$,$Te_2=Te_3=e_1$(图中黄色虚线箭头)。所以 $T\neq0$、$T^2=0$,使 $T^m=0$ 的最小 $m$ 是 2。

第 2 步:拿出最长的链,张成 $U$

取 $u=e_2$,$Tu=e_1\neq0$。链 $u\to Tu\to0$ 张成 $U=\operatorname{span}(e_1,e_2)$(蓝色平面)。$U$ 对 $T$ 不变,但还差一维。

第 3 步:随手挑的补空间不行

$\operatorname{span}(e_3)$(红线)与 $U$ 构成直和,可是 $Te_3=e_1\notin\operatorname{span}(e_3)$——红色箭头跑出了红线,它不是不变子空间,$T$ 在它上面甚至不是一个算子。

第 4 步:用 $\varphi$ 造出不变的补空间 $W$

取 $\varphi(z)=z_1$,满足 $\varphi(T^{m-1}u)=\varphi(e_1)=1\neq0$。令 $W=\{v:\ \varphi(v)=0,\ \varphi(Tv)=0\}=\{z_1=0,\ z_2+z_3=0\}=\operatorname{span}\big((0,1,-1)\big)$(绿线)。$T(0,1,-1)=(0,0,0)$,所以 $W$ 不变。

第 5 步:$V=U\oplus W$,拼出 Jordan 基

$U\cap W=\{0\}$ 且维数 $2+1=3$,所以 $\mathbf{F}^3=U\oplus W$。依次取 $Tu,\ u,\ w=e_1,\ e_2,\ (0,1,-1)$,$T$ 的矩阵是 $\begin{pmatrix}0 & 1 & 0\\ 0 & 0 & 0\\ 0 & 0 & 0\end{pmatrix}$:一个 2×2 Jordan 块加一个 1×1 块。

定理Jordan 标准形Jordan form8.46

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 $V$ 有一组基是 $T$ 的 Jordan 基。

证明

由广义特征空间分解,$V=G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T)$,且每个 $(T-\lambda_kI)|_{G(\lambda_k,T)}$ 幂零(8.22)。由 8.45,每个 $G(\lambda_k,T)$ 有一组基是 $(T-\lambda_kI)|_{G(\lambda_k,T)}$ 的 Jordan 基;在这组基下 $T|_{G(\lambda_k,T)}$ 的矩阵就是对角线换成 $\lambda_k$ 的 Jordan 块。把各房间的基拼起来即得 $T$ 的 Jordan 基。(Camille Jordan 于 1870 年发表了这个结果的证明。)

Jordan 结构搭建器:链图 ↔ 矩阵 ↔ 多项式

选一个预设,或自己添加 Jordan 块(选特征值 λ 与块的大小)。左边是 Jordan 形矩阵,右边是链图:每个点是一个基向量,点上的编号就是矩阵的列号,向下的箭头表示作用一次 $T-\lambda I$。选「关注的特征值」并拖动 $k$:被 $(T-\lambda I)^k$ 消灭的点变成空心,它们恰好张成 $\operatorname{null}(T-\lambda I)^k$。点击下方的块标签可删除该块。

每作用一次 $T-\lambda I$,每条 $\lambda$-链的最底下一个点被消灭,所以 $\dim\operatorname{null}(T-\lambda I)^k$ 每步增加的量 = 长度至少为 $k$ 的链的条数;$k$ 达到最长链长时停止增长。把矩阵显示切换成 $(T-\lambda I)^k$,可以看到每个 $\lambda$-块里的 1 逐步向右上角移动、最终移出块外;而其他特征值的块对角线上是非零的 $(\mu-\lambda)^k$,永远不会被消灭。

如何「读」Jordan 形 对每个特征值 $\lambda$:
  • $\lambda$-块的个数 = 链的条数 = 链底(特征向量)的个数 = $\dim E(\lambda,T)$(几何重数);
  • $\lambda$-块的大小之和 = $\dim G(\lambda,T)$(代数重数);
  • 最大 $\lambda$-块的大小 = 极小多项式中 $(z-\lambda)$ 的指数(习题 8B.18、8C.7);
  • $\dim\operatorname{null}(T-\lambda I)^k=\sum_{\text{λ-块}}\min(k,\text{块大小})$——这组数完全决定了各块的大小,所以 Jordan 形中块的大小(不计排列顺序)由 $T$ 唯一确定。(习题 8C.13 证明了其中「块数 $=\dim\operatorname{null}T$」这一部分。)

动手:求一个具体矩阵的 Jordan 形与 Jordan 基。原书只证明了 Jordan 基存在。下面用一个 3×3 例子演示实际操作的流程(补充内容;每一步都只用到上面的「链图」与「楼梯」)。

第 1 步:求特征值与重数

$A=\begin{pmatrix}3 & 1 & -1\\ 0 & 2 & 0\\ 1 & 1 & 1\end{pmatrix}$。它的特征多项式是 $(z-2)^3$(可用第 9 章的 $\det(zI-A)$ 算出;也可以直接验证 $(A-2I)^2=0$,再由 8.17 知 2 是唯一的特征值)。所以只有一个「房间」:$G(2,A)=\mathbf{C}^3$,重数 3。

第 2 步:算「楼梯」

令 $N=A-2I=\begin{pmatrix}1 & 1 & -1\\ 0 & 0 & 0\\ 1 & 1 & -1\end{pmatrix}$。它的秩是 1,所以 $\dim\operatorname{null}N=2$;又 $N^2=0$,所以 $\dim\operatorname{null}N^2=3$。楼梯:0 → 2 → 3。

第 3 步:从楼梯读出块的大小

每作用一次 $N$,每条链都恰好消失最底下的一个点,所以第 $k$ 级台阶的高度 = 长度 ≥ $k$ 的链的条数。第 1 级高 2 ⇒ 共 2 条链;第 2 级高 1 ⇒ 其中 1 条长度 ≥ 2;总长为 3 ⇒ 链长 2 + 1。Jordan 形为 $\begin{pmatrix}2 & 1 & 0\\ 0 & 2 & 0\\ 0 & 0 & 2\end{pmatrix}$。

第 4 步:先找最长的链

链顶要选一个不在 $\operatorname{null}N$ 里的向量,例如 $v=(1,0,0)$:$Nv=(1,0,1)\neq0$,$N^2v=0$。长链:$v=(1,0,0)\to Nv=(1,0,1)\to0$。

第 5 步:补上短链

$\operatorname{null}N=\{z:\ z_1+z_2-z_3=0\}$ 是一个平面,其中已有长链的链底 $(1,0,1)$。再从这个平面里选一个与它线性无关的向量,例如 $(0,1,1)$,作为长度 1 的链。

第 6 步:拼成 Jordan 基并验算

按「每条链从链底到链顶」排列:$(1,0,1),\ (1,0,0),\ (0,1,1)$。验算:$A(1,0,1)=2(1,0,1)$,$A(1,0,0)=(3,0,1)=(1,0,1)+2(1,0,0)$,$A(0,1,1)=2(0,1,1)$——在这组基下的矩阵正是第 3 步的 Jordan 形。

Jordan 形有什么用?(补充)

① 分类:两个复方阵相似(表示同一个算子)当且仅当它们的 Jordan 形相同(不计块的顺序)——Jordan 形是算子的「身份证」。② 计算幂:一个块 $J=\lambda I+N$ 中 $I$ 与 $N$ 可交换、$N$ 幂零,所以 $J^k=\sum_j\binom{k}{j}\lambda^{k-j}N^j$ 是有限和;2×2 时 $J^k=\begin{pmatrix}\lambda^k & k\lambda^{k-1}\\ 0 & \lambda^k\end{pmatrix}$,右上角的 $k\lambda^{k-1}$ 说明不可对角化时会出现「$k$ 倍」的额外增长。③ 与第 7 章的关系:正规算子的 Jordan 形全是 1×1 块,而且 Jordan 基可以取成规范正交基(复谱定理 7.31)。

常见误区
  • 「Jordan 基是唯一的」✗:链的选法有很多(上面第 4、5 步中的 $v$ 和补充的向量都可以换),唯一确定的只是各个块的大小(不计排列顺序)。
  • 「ℝ 上的算子也都有 Jordan 形」✗:8.46 需要 $\mathbf{F}=\mathbf{C}$。ℝ² 上旋转 90° 没有实特征值,而 Jordan 形的对角元必须是特征值,所以它没有实的 Jordan 形。不过幂零算子在 ℝ 上照样有 Jordan 基(8.45 对 ℝ 也成立)。

一个 7 维空间上的幂零算子,Jordan 块的大小为 3、3、1。$\dim\operatorname{null}T$ 等于多少?

接上题(块大小 3、3、1),$T$ 的极小多项式是什么?

本节要点
  • $I+N$($N$ 幂零)有平方根:把 $\sqrt{1+x}$ 的级数截断;由此在 ℂ 上每个可逆算子都有平方根(逐房间开方)。
  • 幂零算子总能排成若干条链 $T^{m}v,\dots,Tv,v$;按「链底→链顶」排成基,每条链对应一个对角为 0、上方为 1 的块(8.45)。
  • 在 ℂ 上每个算子都有 Jordan 基(8.46):Jordan 块的个数 = 几何重数,大小之和 = 代数重数,最大块 = 极小多项式中的指数。
平方根square root满足 $R^2=T$ 的算子 $R$;ℂ 上可逆算子一定有平方根(8.41)。
Jordan 基Jordan basis使 $T$ 的矩阵成为由 Jordan 块组成的分块对角矩阵的基;ℂ 上总存在(8.46)。
Jordan 块Jordan block对角线全为 $\lambda$、紧挨对角线上方全为 1、其余为 0 的方阵;对应一条链。
Jordan 标准形Jordan form$T$ 在 Jordan 基下的矩阵:除对角线与其上方一条线外全是 0。

8D 迹:矩阵与算子之间的联系 Trace: A Connection Between Matrices and Operators

这一节要解决:矩阵的哪些数值不依赖于基的选择,因而是算子本身的属性?最简单的一个就是迹——对角元之和。它看起来依赖于具体的矩阵,实际上换基不变;在 ℂ 上它还等于特征值(按重数)之和。

定义矩阵的迹trace of a matrix8.47

设 $A$ 是元素属于 $\mathbf{F}$ 的方阵。$A$ 的迹,记作 $\operatorname{tr}A$,定义为 $A$ 的对角元之和。

8.48 例:$A=\begin{pmatrix}\boxed{3} & -1 & -2\\ 5 & \boxed{2} & -3\\ 1 & 6 & \boxed{0}\end{pmatrix}$ 的对角元(方框中)是 3、2、0,所以 $\operatorname{tr}A=3+2+0=5$。

矩阵乘法不可交换,但迹对乘法顺序「视而不见」:

命题AB 的迹等于 BA 的迹trace of AB equals trace of BA8.49

设 $A$ 是 $m\times n$ 矩阵,$B$ 是 $n\times m$ 矩阵。则 $\operatorname{tr}(AB)=\operatorname{tr}(BA)$。

证明:交换求和顺序

$AB$ 的第 $j$ 个对角元是 $\sum_{k=1}^{n}A_{j,k}B_{k,j}$,所以 $$\operatorname{tr}(AB)=\sum_{j=1}^{m}\sum_{k=1}^{n}A_{j,k}B_{k,j}=\sum_{k=1}^{n}\sum_{j=1}^{m}B_{k,j}A_{j,k}=\sum_{k=1}^{n}(BA)_{k,k}=\operatorname{tr}(BA).$$

直觉 $\operatorname{tr}(AB)$ 是把所有「$A$ 的第 $(j,k)$ 个元素 × $B$ 的第 $(k,j)$ 个元素」全部加起来——这个总和对 $A$、$B$ 完全对称,所以谁在前都一样。注意 $AB$ 是 $m\times m$、$BA$ 是 $n\times n$,两者大小可能都不同,迹却相等。例如 $A=\begin{pmatrix}1 & 2\end{pmatrix}$(行向量)、$B=\begin{pmatrix}3\\ 4\end{pmatrix}$(列向量):$AB=(11)$ 是 1×1 的,$BA=\begin{pmatrix}3 & 6\\ 4 & 8\end{pmatrix}$ 是 2×2 的,它们的迹都是 11。
tr(AB) = tr(BA):同一张乘积表,按行加与按列加

$A$ 是 $m\times n$,$B$ 是 $n\times m$。表格第 $j$ 行第 $k$ 列放乘积 $A_{j,k}B_{k,j}$。按行相加得到 $AB$ 的第 $j$ 个对角元,按列相加得到 $BA$ 的第 $k$ 个对角元。改变尺寸或点「随机」,看两种加法的总和是否总相同。

右边一列(蓝)是 $AB$ 的对角元,底下一行(红)是 $BA$ 的对角元;它们只是把同一张表里的 $mn$ 个数按两种顺序加起来,所以和相同——这正是 8.49 证明中「交换求和顺序」那一步。注意 $AB$ 与 $BA$ 本身完全不同(甚至大小都不同),相同的只有迹。

我们想把算子的迹定义为它在某组基下矩阵的迹。这要求结果与基无关——下面的结果保证了这一点:

命题算子矩阵的迹与基无关trace of matrix of operator does not depend on basis8.50

设 $T\in\mathcal{L}(V)$,$u_1,\dots,u_n$ 与 $v_1,\dots,v_n$ 都是 $V$ 的基。则 $$\operatorname{tr}\mathcal{M}\big(T,(u_1,\dots,u_n)\big)=\operatorname{tr}\mathcal{M}\big(T,(v_1,\dots,v_n)\big).$$

证明

记两个矩阵为 $A$、$B$。由换基公式(3.84),存在可逆矩阵 $C$ 使 $A=C^{-1}BC$。于是由 8.49: $$\operatorname{tr}A=\operatorname{tr}\big((C^{-1}B)C\big)=\operatorname{tr}\big(C(C^{-1}B)\big)=\operatorname{tr}\big((CC^{-1})B\big)=\operatorname{tr}B.$$

定义算子的迹trace of an operator8.51

设 $T\in\mathcal{L}(V)$。$T$ 的迹定义为 $\operatorname{tr}T=\operatorname{tr}\mathcal{M}\big(T,(v_1,\dots,v_n)\big)$,其中 $v_1,\dots,v_n$ 是 $V$ 的任意一组基。

换基不换迹:拖动基向量,矩阵在变,迹不变

固定一个算子 $T$(选预设),拖动基向量 $b_1$、$b_2$ 的尖端。浅色虚线箭头是 $Tb_1$、$Tb_2$;粗的半透明线段是 $Tb_1$ 沿 $b_1$ 方向的分量 $B_{11}b_1$ 和 $Tb_2$ 沿 $b_2$ 方向的分量 $B_{22}b_2$——$B_{11},B_{22}$ 正是 $B=\mathcal{M}(T,(b_1,b_2))$ 的两个对角元(按基 $b_1,b_2$ 分解时的系数)。下方数轴上两段箭头依次表示 $B_{11}$ 与 $B_{22}$。

无论怎样拖动 $b_1,b_2$,矩阵 $B$ 的四个元素都在变,两段对角元箭头也忽长忽短(甚至变负),但它们首尾相接的终点始终停在同一个位置 $\operatorname{tr}T$。选「特征向量基」时 $B$ 变成对角矩阵,对角元就是特征值——于是迹 = 特征值之和。旋转型的例子没有实特征向量,但两个复特征值 $1\pm2i$ 之和 2 仍然等于迹。

下面的结果中,「特征值之和,每个特征值按重数重复计入」的意思是:若互异特征值 $\lambda_1,\dots,\lambda_m$ 的重数为 $d_1,\dots,d_m$,则和为 $d_1\lambda_1+\cdots+d_m\lambda_m$;或者把特征值按重数列成 $\lambda_1,\dots,\lambda_n$($n=\dim V$),和为 $\lambda_1+\cdots+\lambda_n$。

定理在复向量空间上,迹等于特征值之和on complex vector spaces, trace equals sum of eigenvalues8.52

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$。则 $\operatorname{tr}T$ 等于 $T$ 的特征值之和,每个特征值按其重数重复计入。

证明

由 8.37,存在一组基使 $T$ 的矩阵是上三角的,且对角元恰是全部特征值、每个出现的次数等于其重数。迹可以用任何一组基来算(8.50),用这组基算,对角元之和就是特征值(按重数)之和。

例$\mathbf{C}^3$ 上算子的迹trace of an operator on C³8.53

$T(z_1,z_2,z_3)=(3z_1-z_2-2z_3,\ 3z_1+2z_2-3z_3,\ z_1+2z_2)$ 在标准基下的矩阵是 $\begin{pmatrix}3 & -1 & -2\\ 3 & 2 & -3\\ 1 & 2 & 0\end{pmatrix}$,对角元相加得 $\operatorname{tr}T=5$。它的特征值是 $1,\ 2+3i,\ 2-3i$(各重数 1),和为 $1+(2+3i)+(2-3i)=5$,与 8.52 一致。

迹与特征多项式紧密相关。设 $\mathbf{F}=\mathbf{C}$,特征值按重数列为 $\lambda_1,\dots,\lambda_n$,则特征多项式(8.26)展开后是 $$(z-\lambda_1)\cdots(z-\lambda_n)=z^n-(\lambda_1+\cdots+\lambda_n)z^{n-1}+\cdots+(-1)^n(\lambda_1\cdots\lambda_n).$$

推论迹与特征多项式trace and characteristic polynomial8.54

设 $\mathbf{F}=\mathbf{C}$,$T\in\mathcal{L}(V)$,$n=\dim V$。则 $\operatorname{tr}T$ 等于特征多项式中 $z^{n-1}$ 的系数的相反数。

例如 2×2 的情形:特征多项式 $=z^2-(\operatorname{tr}T)\,z+\lambda_1\lambda_2$。第 9 章的 9.65 会在不要求 $\mathbf{F}=\mathbf{C}$ 的情况下得到同样的结论(常数项与行列式有关)。

命题内积空间上的迹trace on an inner product space8.55

设 $V$ 是内积空间,$T\in\mathcal{L}(V)$,$e_1,\dots,e_n$ 是 $V$ 的规范正交基。则 $$\operatorname{tr}T=\langle Te_1,e_1\rangle+\cdots+\langle Te_n,e_n\rangle.$$

因为矩阵 $\mathcal{M}(T,(e_1,\dots,e_n))$ 第 $k$ 行第 $k$ 列的元素就是 $\langle Te_k,e_k\rangle$(6.30(a))。几何上:把每个 $Te_k$ 投影回 $e_k$ 方向,量出「$e_k$ 被保留了多少」,再全部加起来——这和演示中「$Tb_k$ 沿 $b_k$ 方向的分量」是同一个想法,只是换成了正交投影。

矩阵的迹的代数性质会自动传给算子的迹:

命题迹是线性的trace is linear8.56

函数 $\operatorname{tr}:\mathcal{L}(V)\to\mathbf{F}$ 是 $\mathcal{L}(V)$ 上的线性泛函,并且对所有 $S,T\in\mathcal{L}(V)$ 有 $\operatorname{tr}(ST)=\operatorname{tr}(TS)$。

证明思路

取定一组基,把算子都换成矩阵:$\mathcal{M}(\lambda T)=\lambda\mathcal{M}(T)$、$\mathcal{M}(S+T)=\mathcal{M}(S)+\mathcal{M}(T)$(3.38、3.35),而矩阵的迹显然线性。又 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$(3.43),关键一步 $\operatorname{tr}(\mathcal{M}(S)\mathcal{M}(T))=\operatorname{tr}(\mathcal{M}(T)\mathcal{M}(S))$ 来自 8.49。

事实上,$\operatorname{tr}(ST)=\operatorname{tr}(TS)$ 与 $\operatorname{tr}I=\dim V$ 这两条性质在 $\mathcal{L}(V)$ 的所有线性泛函中唯一地刻画了迹(习题 8D.10)。

常见误区 迹对加法和数乘线性,但对乘法不是乘性的:一般 $\operatorname{tr}(ST)\neq(\operatorname{tr}S)(\operatorname{tr}T)$。例如 $S=T=I$(在 $\mathbf{F}^2$ 上):$\operatorname{tr}(ST)=2$,而 $(\operatorname{tr}S)(\operatorname{tr}T)=4$(习题 8D.8)。

等式 $\operatorname{tr}(ST)=\operatorname{tr}(TS)$ 带来一个出人意料的结论。它的陈述里根本没有迹,证明却只用迹——当数学里出现这种情况时,背后通常藏着一个好的定义。

定理恒等算子不是 ST 与 TS 之差identity operator is not the difference of ST and TS8.57

不存在算子 $S,T\in\mathcal{L}(V)$ 使得 $ST-TS=I$。

证明

对任意 $S,T$,由 8.56,$\operatorname{tr}(ST-TS)=\operatorname{tr}(ST)-\operatorname{tr}(TS)=0$;而 $\operatorname{tr}I=\dim V\neq0$($V$ 非零)。迹不同,二者不可能相等。

无穷维时不再成立 这个结论依赖有限维(迹要能定义)。在全体多项式构成的无穷维空间 $\mathcal{P}(\mathbf{F})$ 上,取 $S=D$(求导)、$T=$「乘以 $x$」,则 $(ST-TS)p=(xp)'-xp'=p$,即 $ST-TS=I$(习题 8D.13)。在对 $S,T,V$ 加上额外条件后,8.57 有无穷维的推广,在量子力学中很重要(位置与动量算子的对易关系只能在无穷维空间中实现)。

某 3×3 复矩阵的特征值(按重数)是 2、2、−1,对角元是 1、$x$、0。$x$ 等于多少?

本节要点
  • $\operatorname{tr}(AB)=\operatorname{tr}(BA)$ ⇒ 相似矩阵迹相同 ⇒ 算子的迹有意义(与基无关)。
  • 在 ℂ 上,$\operatorname{tr}T$ = 特征值按重数之和 = 特征多项式 $z^{n-1}$ 系数的相反数。
  • 迹是线性泛函且 $\operatorname{tr}(ST)=\operatorname{tr}(TS)$;由此有限维空间上 $ST-TS\neq I$。
矩阵的迹trace of a matrix方阵对角元之和 $\operatorname{tr}A$;满足 $\operatorname{tr}(AB)=\operatorname{tr}(BA)$。
算子的迹trace of an operator$\operatorname{tr}T=\operatorname{tr}\mathcal{M}(T)$,与基无关;ℂ 上等于特征值按重数之和。

本章小结

  • 零空间链(8.1–8.4):$\operatorname{null}T^k$ 递增,一旦持平就永远持平,最迟在 $k=\dim V$ 持平;此时 $V=\operatorname{null}T^{n}\oplus\operatorname{range}T^{n}$。这是后面一切分解的「发动机」。
  • 广义特征向量(8.8–8.12):$(T-\lambda I)^kv=0$。每个广义特征向量只对应一个特征值;不同特征值的广义特征向量线性无关;在 ℂ 上它们足以组成基。
  • 幂零算子(8.14–8.18):某个幂为 0 ⇔ 极小多项式 $z^m$ ⇔ 有严格上三角矩阵;必有 $T^{\dim V}=0$;ℂ 上「只有特征值 0」即等价于幂零。
  • 广义特征空间分解(8.22):ℂ 上 $V=\bigoplus_k G(\lambda_k,T)$,每块不变,块上 $T=\lambda_kI+$ 幂零。重数 $=\dim G$;特征多项式 $\prod(z-\lambda_k)^{d_k}$;Cayley–Hamilton $q(T)=0$;矩阵可化为上三角块组成的分块对角形(8.37)。
  • 推论(8C):ℂ 上可逆算子有平方根(级数截断 + 逐房间开方);每个算子有 Jordan 基——幂零部分排成链,一条链就是一个 Jordan 块。
  • 迹(8D):$\operatorname{tr}(AB)=\operatorname{tr}(BA)$ ⇒ 迹与基无关;ℂ 上等于特征值按重数之和;迹线性且 $\operatorname{tr}(ST)=\operatorname{tr}(TS)$ ⇒ $ST-TS\neq I$。

概念之间的联系:8.4(零空间与值域分得开)⟶ 8.9(广义特征向量成基)+ 8.12(互相独立)⟶ 8.22 广义特征空间分解 ⟶ 重数与特征多项式、Cayley–Hamilton、分块对角矩阵(8B),平方根与 Jordan 形(8C),迹 = 特征值之和(8D)。

与前后章节:第 5 章的上三角化(5.44)与极小多项式,在这里被细化为分块对角形与 Jordan 形;第 7 章的复谱定理可以看成 Jordan 形的特殊情形:正规算子的 Jordan 块全是 1×1,而且 Jordan 基可以取成规范正交基;第 9 章会用行列式重新定义特征多项式,并证明它与本章的定义一致(9.62),还会把迹、行列式与特征多项式的系数联系起来(9.65)。

特征向量 / 特征空间广义特征向量 / 广义特征空间
条件$(T-\lambda I)v=0$$(T-\lambda I)^k v=0$(取 $k=\dim V$ 即可)
子空间$E(\lambda,T)=\operatorname{null}(T-\lambda I)$$G(\lambda,T)=\operatorname{null}(T-\lambda I)^{\dim V}$
维数几何重数(代数)重数
ℂ 上能否组成基仅当可对角化总能(8.9)
直和分解$V=\bigoplus E(\lambda_k,T)$ 仅当可对角化$V=\bigoplus G(\lambda_k,T)$ 总成立(ℂ 上,8.22)
最简矩阵对角矩阵分块对角(8.37)→ Jordan 形(8.46)
极小多项式特征多项式
定义使 $p(T)=0$ 的次数最低的首一多项式$\prod(z-\lambda_k)^{d_k}$,$d_k=\dim G(\lambda_k,T)$
$(z-\lambda)$ 的指数最大 $\lambda$-Jordan 块的大小所有 $\lambda$-块大小之和(代数重数)
次数$\le\dim V$$=\dim V$
关系特征多项式是极小多项式的倍式(8.30);零点都恰是全部特征值

自测

对任意 $T\in\mathcal{L}(V)$,$n=\dim V$,下列哪一项总成立?

$\dim V=4$,$T$ 的特征多项式是 $(z-2)^3(z-5)$。下列哪个算子一定等于 0?

设 $\mathbf{F}=\mathbf{C}$。$T$ 可对角化当且仅当:

$\mathbf{C}^4$ 上的算子 $T$ 只有特征值 3,$\dim\operatorname{null}(T-3I)=2$,且 $(T-3I)^2=0$。它的 Jordan 块大小是?

$T$ 是 5 维空间上的幂零算子,且 $\dim\operatorname{range}T=2$。下列说法哪个正确?

是否存在 2×2 复矩阵 $S,T$ 使 $ST-TS=I$?

习题

选自原书各节末的习题,编号为原书编号(如 8A.1 = 8A 节第 1 题)。先自己想,再看提示和参考解答。

8A.1设 $T\in\mathcal{L}(V)$。证明:若 $\dim\operatorname{null}T^4=8$ 且 $\dim\operatorname{null}T^6=9$,则对所有整数 $m\ge5$ 有 $\dim\operatorname{null}T^m=9$。
提示看 $\operatorname{null}T^4\subseteq\operatorname{null}T^5\subseteq\operatorname{null}T^6$ 这三级楼梯:第一级到第三级只升高了 1。
参考解答

若 $\operatorname{null}T^4=\operatorname{null}T^5$,则由 8.2 有 $\operatorname{null}T^6=\operatorname{null}T^4$,维数应为 8,矛盾。所以 $\operatorname{null}T^4\subsetneq\operatorname{null}T^5$,$\dim\operatorname{null}T^5\ge9$;又 $\operatorname{null}T^5\subseteq\operatorname{null}T^6$,故 $\dim\operatorname{null}T^5\le9$。于是 $\dim\operatorname{null}T^5=9=\dim\operatorname{null}T^6$,即 $\operatorname{null}T^5=\operatorname{null}T^6$(一个子空间包含于另一个且维数相同)。再由 8.2,对所有 $m\ge5$,$\operatorname{null}T^m=\operatorname{null}T^5$,维数为 9。

8A.2设 $T\in\mathcal{L}(V)$,$m$ 是正整数,$v\in V$,且 $T^{m-1}v\neq0$ 但 $T^mv=0$。证明 $v,Tv,T^2v,\dots,T^{m-1}v$ 线性无关。(8.45 的证明用到了这个结论。)
提示设一个线性组合为 0,两边作用 $T^{m-1}$;再作用 $T^{m-2}$……逐个消去系数。
参考解答

设 $a_0v+a_1Tv+\cdots+a_{m-1}T^{m-1}v=0$。两边作用 $T^{m-1}$:凡含 $T^{j}v$($j\ge1$)的项变为 $T^{m-1+j}v=0$,只剩 $a_0T^{m-1}v=0$,因 $T^{m-1}v\neq0$ 得 $a_0=0$。再对剩下的式子作用 $T^{m-2}$,得 $a_1T^{m-1}v=0$,故 $a_1=0$。依此类推,所有 $a_j=0$。

8A.3设 $T\in\mathcal{L}(V)$。证明 $V=\operatorname{null}T\oplus\operatorname{range}T\iff\operatorname{null}T^2=\operatorname{null}T$。
提示模仿 8.4 的证明:关键是 $\operatorname{null}T\cap\operatorname{range}T=\{0\}$。
参考解答

(⇒) 设 $v\in\operatorname{null}T^2$,则 $Tv\in\operatorname{range}T$ 且 $T(Tv)=0$,即 $Tv\in\operatorname{null}T\cap\operatorname{range}T=\{0\}$,所以 $v\in\operatorname{null}T$。故 $\operatorname{null}T^2\subseteq\operatorname{null}T$,另一方向由 8.1 给出。

(⇐) 设 $v\in\operatorname{null}T\cap\operatorname{range}T$,$v=Tu$,则 $T^2u=Tv=0$,$u\in\operatorname{null}T^2=\operatorname{null}T$,所以 $v=Tu=0$。于是 $\operatorname{null}T+\operatorname{range}T$ 是直和,维数为 $\dim\operatorname{null}T+\dim\operatorname{range}T=\dim V$(3.21),所以等于 $V$。

8A.10定义 $T\in\mathcal{L}(\mathbf{C}^2)$ 为 $T(w,z)=(z,0)$。求 $T$ 的全部广义特征向量。
提示先求特征值;再算 $T^2$。
参考解答

$T^2(w,z)=T(z,0)=(0,0)$,所以 $T$ 幂零,唯一特征值是 0(8.17)。由于 $T^2=0$,每个非零向量 $v$ 都满足 $(T-0I)^2v=0$。所以 $T$ 的广义特征向量就是 $\mathbf{C}^2$ 中全部非零向量(都对应特征值 0),而特征向量只有 $(w,0)$,$w\neq0$。

8A.14设 $T\in\mathcal{L}(V)$ 幂零且 $T\neq0$。证明 $T$ 不可对角化。
提示幂零算子的特征值只有 0。
参考解答

若 $T$ 可对角化,则存在基使 $T$ 的矩阵是对角矩阵,对角元都是 $T$ 的特征值。由 8.17(a),$T$ 唯一的特征值是 0,所以这个对角矩阵是零矩阵,$T=0$,与 $T\neq0$ 矛盾。

8A.17设 $T\in\mathcal{L}(V)$ 幂零,$m$ 是使 $T^m=0$ 的正整数。(a) 证明 $I-T$ 可逆,且 $(I-T)^{-1}=I+T+\cdots+T^{m-1}$。(b) 你会怎样猜出这个公式?
提示(a) 直接相乘,中间项两两抵消。(b) 想想 $\frac1{1-x}$ 的展开。
参考解答

(a) $(I-T)(I+T+\cdots+T^{m-1})=I+T+\cdots+T^{m-1}-T-T^2-\cdots-T^m=I-T^m=I$;同理右乘也得 $I$(各项都是 $T$ 的多项式,可交换)。所以 $I-T$ 可逆,逆为 $I+T+\cdots+T^{m-1}$。

(b) 由几何级数 $\frac1{1-x}=1+x+x^2+\cdots$($|x|\lt1$),把 $x$ 换成 $T$:因 $T^m=0$,无穷级数变成有限和——与 8.39 中 $\sqrt{1+x}$ 的级数截断是同一个思想。

8B.1定义 $T\in\mathcal{L}(\mathbf{C}^2)$ 为 $T(w,z)=(-z,w)$。求 $T$ 的各个互异特征值对应的广义特征空间。
提示这是「旋转 90°」。在 ℂ 上解 $T(w,z)=\lambda(w,z)$。
参考解答

由 $-z=\lambda w$、$w=\lambda z$ 得 $w=-\lambda^2w$,非零解要求 $\lambda^2=-1$,即 $\lambda=\pm i$。$\lambda=i$:$w=iz$,特征向量 $(1,-i)$(检验:$T(1,-i)=(i,1)=i(1,-i)$);$\lambda=-i$:特征向量 $(1,i)$。两个特征值互异,重数之和为 2(8.25),所以每个重数为 1,广义特征空间就是特征空间:$G(i,T)=\operatorname{span}((1,-i))$,$G(-i,T)=\operatorname{span}((1,i))$。

8B.12给出 $\mathbf{C}^4$ 上一个算子的例子,使其特征多项式为 $(z-1)(z-5)^3$,极小多项式为 $(z-1)(z-5)^2$。
提示用 Jordan 块来搭:5 的块大小之和为 3,最大块为 2。可以在上面的「Jordan 结构搭建器」中选对应预设验证。
参考解答

取 Jordan 结构:特征值 1 的 1×1 块,特征值 5 的一个 2×2 块和一个 1×1 块,即 $T(z_1,z_2,z_3,z_4)=(z_1,\ 5z_2+z_3,\ 5z_3,\ 5z_4)$,矩阵为 $\operatorname{diag}\Big((1),\begin{pmatrix}5 & 1\\ 0 & 5\end{pmatrix},(5)\Big)$。特征值 1 的重数 1、5 的重数 3,故特征多项式为 $(z-1)(z-5)^3$。在 $G(5,T)$ 上 $(T-5I)^2=0$ 但 $T-5I\neq0$($(T-5I)e_3=e_2$),在 $G(1,T)$ 上 $T-I=0$,所以极小多项式为 $(z-1)(z-5)^2$。

8B.16设 $T\in\mathcal{L}(\mathbf{C}^6)$,$T(z_1,z_2,z_3,z_4,z_5,z_6)=(0,z_1,z_2,0,z_4,0)$。求 $T$ 的特征多项式与极小多项式。
提示这就是例 8.43 的算子:它是幂零的,链长为 3、2、1。
参考解答

$T^3=0$,所以 $T$ 幂零,唯一特征值 0 的重数为 6,特征多项式为 $z^6$。又 $T^2e_1=e_3\neq0$,所以 $T^2\neq0$;极小多项式是 $z^m$ 形式(8.18)且 $m$ 是使 $T^m=0$ 的最小正整数,故为 $z^3$(= 最长链的长度)。

8C.1设 $T\in\mathcal{L}(\mathbf{C}^3)$,$T(z_1,z_2,z_3)=(z_2,z_3,0)$。证明 $T$ 没有平方根。
提示若 $R^2=T$,则 $R$ 也是幂零的;用 8.16 看 $R^3$。
参考解答

设 $R^2=T$。$T^3=0$,所以 $R^6=T^3=0$,$R$ 幂零;由 8.16($\dim\mathbf{C}^3=3$),$R^3=0$。于是 $T^2=R^4=R^3R=0$。但 $T^2(z_1,z_2,z_3)=(z_3,0,0)$,$T^2\neq0$,矛盾。

8C.2定义 $T\in\mathcal{L}(\mathbf{F}^5)$ 为 $T(x_1,x_2,x_3,x_4,x_5)=(2x_2,\ 3x_3,\ -x_4,\ 4x_5,\ 0)$。(a) 证明 $T$ 幂零。(b) 求 $I+T$ 的一个平方根。
提示(a) 看矩阵的形状。(b) 用 8.39 的系数:$\sqrt{I+T}=I+\frac12T-\frac18T^2+\frac1{16}T^3-\frac5{128}T^4$。
参考解答

(a) $T$ 在标准基下的矩阵严格上三角,所以 $T^5=0$(8.18)。具体地:$T^2x=(6x_3,-3x_4,-4x_5,0,0)$,$T^3x=(-6x_4,-12x_5,0,0,0)$,$T^4x=(-24x_5,0,0,0,0)$,$T^5=0$。

(b) 令 $R=I+\frac12T-\frac18T^2+\frac1{16}T^3-\frac5{128}T^4$(系数来自 $\sqrt{1+x}$ 的泰勒级数,见 8.39 下的表格),代入上面的幂得 $$R(x)=\Big(x_1+x_2-\tfrac34x_3-\tfrac38x_4+\tfrac{15}{16}x_5,\ \ x_2+\tfrac32x_3+\tfrac38x_4-\tfrac34x_5,\ \ x_3-\tfrac12x_4+\tfrac12x_5,\ \ x_4+2x_5,\ \ x_5\Big).$$ 可以直接验证 $R^2=I+T$(系数正是按「$R^2$ 中 $T^k$ 的系数为 0」逐个解出的)。

8C.5设 $T\in\mathcal{L}(\mathbf{C}^2)$,$T(w,z)=(-w-z,\ 9w+5z)$。求 $T$ 的一组 Jordan 基。
提示先由迹与特征多项式求特征值;再取 $v$ 使 $(T-\lambda I)v\neq0$,用链 $(T-\lambda I)v,\ v$。
参考解答

矩阵 $\begin{pmatrix}-1 & -1\\ 9 & 5\end{pmatrix}$,迹 4。解 $T(w,z)=\lambda(w,z)$ 得特征多项式 $(\lambda+1)(\lambda-5)+9=\lambda^2-4\lambda+4=(\lambda-2)^2$,唯一特征值 2。$T-2I$ 的矩阵 $\begin{pmatrix}-3 & -1\\ 9 & 3\end{pmatrix}$ 的平方为 0,但它本身不为 0。取 $v=(1,0)$,$(T-2I)v=(-3,9)$。于是 $(-3,9),\ (1,0)$ 是 Jordan 基:$T(-3,9)=2(-3,9)$,$T(1,0)=(-1,9)=(-3,9)+2(1,0)$,矩阵为 $\begin{pmatrix}2 & 1\\ 0 & 2\end{pmatrix}$。

8C.6求 $\mathcal{P}_4(\mathbf{R})$ 的一组基,使它是求导算子 $Dp=p'$ 的 Jordan 基。
提示$D$ 幂零且 $D^4x^4\neq0$,所以只有一条长度为 5 的链:从 $x^4$ 出发反复求导。
参考解答

以 $v=x^4$ 为链顶:$D^4v=24,\ D^3v=24x,\ D^2v=12x^2,\ Dv=4x^3,\ v=x^4$。按链底到链顶排列 $24,\ 24x,\ 12x^2,\ 4x^3,\ x^4$ 就是 Jordan 基,$D$ 的矩阵是 5×5 的、对角线为 0、上方全为 1 的单个 Jordan 块。(等价地,更干净的一组是 $1,\ x,\ \frac{x^2}{2!},\ \frac{x^3}{3!},\ \frac{x^4}{4!}$,因为 $D\frac{x^k}{k!}=\frac{x^{k-1}}{(k-1)!}$。)

8D.2设 $P\in\mathcal{L}(V)$ 满足 $P^2=P$。证明 $\operatorname{tr}P=\dim\operatorname{range}P$。
提示$P^2=P$ 意味着 $P$ 在 $\operatorname{range}P$ 上是恒等,而 $V=\operatorname{null}P\oplus\operatorname{range}P$。选一组适应这个分解的基。
参考解答

若 $w=Pu\in\operatorname{range}P$,则 $Pw=P^2u=Pu=w$;所以 $P$ 在 $\operatorname{range}P$ 上是恒等。又 $\operatorname{null}P^2=\operatorname{null}P$,由习题 8A.3,$V=\operatorname{null}P\oplus\operatorname{range}P$。取 $\operatorname{range}P$ 的基 $u_1,\dots,u_r$ 和 $\operatorname{null}P$ 的基 $w_1,\dots,w_s$,拼成 $V$ 的基。在这组基下 $P$ 的矩阵是 $\operatorname{diag}(1,\dots,1,0,\dots,0)$($r$ 个 1),所以 $\operatorname{tr}P=r=\dim\operatorname{range}P$。

8D.7设 $T\in\mathcal{L}(\mathbf{C}^3)$ 的矩阵是 $\begin{pmatrix}51 & -12 & -21\\ 60 & -40 & -28\\ 57 & -68 & 1\end{pmatrix}$。有人(正确地)告诉你 $-48$ 和 $24$ 是 $T$ 的特征值。不用计算机、不动笔,求第三个特征值。
提示迹 = 特征值按重数之和。
参考解答

$\operatorname{tr}T=51-40+1=12$。由 8.52,三个特征值(按重数)之和为 12,记三个特征值(按重数)为 $-48,\ 24,\ \lambda$,则 $-48+24+\lambda=12$,所以 $\lambda=36$。

第 9 章

多重线性代数与行列式 Multilinear Algebra and Determinants

行列式终于登场——但 Axler 不从那个有 $n!$ 项的公式出发。他先证明「$n$ 维空间上的交错 $n$-线性型只构成一个一维空间」,于是任何算子 $T$ 在这条「一维直线」上只能做一件事:乘以一个数。这个数就是 $\det T$。

学习目标
  • 把双线性型看成「吃两个向量、吐一个数、每个槽分别线性」的机器;会写它在一组基下的矩阵,会用换基公式 $A=C^{\mathrm t}BC$,并说清它和算子换基公式 $C^{-1}BC$ 的区别。
  • 理解对称双线性型总能对角化,从而二次型总能写成「平方的加权和」;能从等高线读出椭圆、双曲线与退化情形及主轴。
  • 把交错多重线性型理解为「有向面积 / 有向体积」;会数逆序求置换的符号;明白为什么 $\dim V^{(n)}_{\mathrm{alt}}=1$。
  • 掌握行列式的无坐标定义 $\alpha_T=(\det T)\,\alpha$,并由它推出 $\det(ST)=\det S\cdot\det T$、可逆 $\Leftrightarrow\det\neq0$、行列式 = 特征值之积 = 带符号的体积缩放倍数。
  • 会用 $\det(zI-T)$ 定义特征多项式,理解实向量空间上的 Cayley–Hamilton 定理、Hadamard 不等式与 Vandermonde 行列式。
  • 理解张量积 $V\otimes W$ 的构造与基;在 $\mathbf F^m\otimes\mathbf F^n$ 中把 $v\otimes w$ 看成秩一矩阵,理解「双线性映射 ↔ $V\otimes W$ 上的线性映射」这一泛性质。
一分钟速览
  • 双线性型 $\beta(u,v)$ 对两个槽分别线性;取一组基后它就是一个矩阵 $A$,$\beta(x,y)=x^{\mathrm t}Ay$。换基时矩阵变成 $C^{\mathrm t}AC$——两个输入都要换坐标,输出是数不用换,所以不是 $C^{-1}AC$。
  • 每个双线性型 = 对称部分 ⊕ 交错部分(9.17)。二次型 $q(v)=\beta(v,v)$ 只「看得见」对称部分;对称型总有一组基使矩阵对角(9.12),所以二次型总能写成 $\lambda_1x_1^2+\cdots+\lambda_nx_n^2$(9.23)。
  • 交错型:两个输入相同就得 0。由此推出:交换两个输入会变号,输入线性相关就得 0——这正是「有向面积 / 体积」的行为。
  • 置换的符号 $=(-1)^{\text{逆序数}}$,交换两个元素必定翻转符号(9.34)。于是一个交错 $n$-型完全由 $\alpha(e_1,\dots,e_n)$ 这一个数决定:$\dim V^{(n)}_{\mathrm{alt}}=1$(9.37)。
  • 行列式的定义:$T$ 把交错 $n$-型 $\alpha$ 变成 $\alpha_T(v_1,\dots,v_n)=\alpha(Tv_1,\dots,Tv_n)$;一维空间上的线性映射只能是「乘以一个数」,这个数就是 $\det T$(9.41)。
  • 这个定义让重要性质几乎「白送」:$\det(ST)=\det S\cdot\det T$;$T$ 可逆 $\Leftrightarrow\det T\neq0$;复空间上 $\det T$ = 特征值之积(按重数);$|\det T|$ = 体积缩放倍数 = 奇异值之积。
  • 特征多项式改用 $\det(zI-T)$ 定义,实、复空间都适用;Cayley–Hamilton 定理从此对实向量空间也成立(9.64)。
  • 张量积 $V\otimes W$ 的维数是 $\dim V\cdot\dim W$。在 $\mathbf F^m\otimes\mathbf F^n$ 中 $v\otimes w$ 就是秩一矩阵 $vw^{\mathrm t}$,一般元素是若干个秩一矩阵之和;$V\times W$ 上的双线性映射与 $V\otimes W$ 上的线性映射一一对应(9.79)。
本章地图 9A 双线性型 9B 交错多重线性型 9C 行列式 9D 张量积 推广到 V×W 上 双线性型矩阵 · 换基 CᵗBC 对称 ⊕ 交错9.12 · 9.17 二次型平方和 · 9.23 m-线性型逐槽线性 · 9.25 交错型 · 置换符号交换即变号 · 9.35 交错 n-型只有一维9.37 全章的钥匙 det T 的定义一维上的「倍数」· 9.41 乘法性 · 可逆性9.49 · 9.50 特征值之积 · 体积9.55 · 9.61 特征多项式Cayley–Hamilton 双线性泛函dim = 乘积 · 9.70 张量积 V⊗W= B(V′, W′) · 9.71 泛性质双线性 ↔ 线性 一维 ⟹ T 只能 「乘以一个数」 点击方框 跳到对应小节
本章约定(standing assumptions)
  • $\mathbf F$ 表示 $\mathbf R$ 或 $\mathbf C$;
  • $V$ 与 $W$ 表示 $\mathbf F$ 上的有限维非零向量空间。

先看全章的故事线。前八章刻意不用行列式;到了最后一章,Axler 用一条很干净的路线把它请回来:

  1. 9A:从「吃一个向量」的线性泛函,走到「吃两个向量」的双线性型,顺带把二次型(椭圆、双曲线……)讲清楚;
  2. 9B:再推广到「吃 $m$ 个向量」的多重线性型,其中「交错」的那一类表现得就像有向体积;关键结论是:在 $n$ 维空间上,交错 $n$-线性型只构成一维空间;
  3. 9C:既然只有一维,算子 $T$ 作用上去只能乘一个数——定义它为 $\det T$。所有熟悉的行列式性质都从这一句话里长出来;
  4. 9D:换一个方向推广双线性,构造张量积 $V\otimes W$,让「向量乘向量」变得有意义。
章首插图的故事 原书本章首页是哥廷根大学数学研究所的照片。这栋楼 1930 年启用时,Emmy Noether(1882–1935)已在该校做了 15 年研究与教学(前 8 年没有薪水);1933 年她被纳粹政府解职。那时她与合作者已经奠定了现代代数的许多基础——本章「先抽象、后计算」的写法,正是这种抽象代数观点的延续。

9A 双线性型与二次型 Bilinear Forms and Quadratic Forms

这一节要回答:线性泛函「吃一个向量、吐一个数」;如果一个函数吃两个向量、吐一个数,而且对每个输入都线性,它有什么结构?答案是:取定一组基后它就是一个方阵,但这个方阵换基的规律和算子不同;它总能拆成「对称 + 交错」两部分;对称的那部分决定了二次型(椭圆、双曲线的代数来源),而且总能被对角化。

双线性型 Bilinear Forms

最熟悉的「吃两个向量」的函数是实内积 $\langle u,v\rangle$。把内积的对称性、正定性都去掉,只保留「每个槽分别线性」,就得到双线性型。

定义双线性型bilinear form9.1

$V$ 上的双线性型(bilinear form)是函数 $\beta:V\times V\to\mathbf F$,使得对每个 $u\in V$, $$v\mapsto\beta(v,u)\quad\text{与}\quad v\mapsto\beta(u,v)$$ 都是 $V$ 上的线性泛函(linear functional)。

直觉:逐槽线性 把一个槽「冻住」,另一个槽就变成第 3 章的线性泛函——在 $\mathbf R^2$ 里,线性泛函的等值线是一族等间距的平行直线(0 号线过原点)。所以双线性型就是:「每冻住一个输入,就得到一族平行等值线;冻住的输入一变,这族直线就跟着转动、变疏变密」。下面的演示就是这幅图。
Axler 的页边注 「线性泛函」指映到标量域 $\mathbf F$ 的线性函数,所以其实叫 bilinear functional 更一致;只是 bilinear form 这个名字已经成了惯例。

和内积比一比:

  • 若 $V$ 是实内积空间,$(u,v)\mapsto\langle u,v\rangle$ 是双线性型;
  • 若 $V$ 是非零的复内积空间,它不是双线性型——复数从第二个槽提出来时要取共轭;
  • 当 $\mathbf F=\mathbf R$ 时,内积比双线性型多两条要求:对称 $\beta(v,w)=\beta(w,v)$ 与正定 $\beta(v,v)\gt 0\ (v\neq0)$。双线性型两条都不要求。
例双线性型的例子bilinear forms9.2
  • $\mathbf F^3$ 上:$\beta\big((x_1,x_2,x_3),(y_1,y_2,y_3)\big)=x_1y_2-5x_2y_3+2x_3y_1$。
  • 任取 $n\times n$ 矩阵 $A$,定义 $\beta_A(x,y)=\sum_{k=1}^n\sum_{j=1}^n A_{j,k}\,x_jy_k$(把 $x,y$ 写成列向量,就是 $x^{\mathrm t}Ay$)。上一条正是 $A=\begin{pmatrix}0 & 1 & 0\\ 0 & 0 & -5\\ 2 & 0 & 0\end{pmatrix}$ 的情形。
  • $V$ 为实内积空间、$T\in\mathcal L(V)$:$\beta(u,v)=\langle u,Tv\rangle$。
  • $\mathcal P_n(\mathbf R)$ 上:$\beta(p,q)=p(2)\cdot q'(3)$。
  • $\varphi,\tau\in V'$:$\beta(u,v)=\varphi(u)\cdot\tau(v)$;更一般地,$\varphi_1(u)\tau_1(v)+\cdots+\varphi_n(u)\tau_n(v)$(习题 9A.2 说明:每个双线性型都能写成这种形式)。
常见误区:双线性 ≠ 在 V×V 上线性 $V\times V$ 本身是向量空间,但双线性型一般不是 $V\times V$ 上的线性映射。展开 $\beta(u_1+u_2,\,v_1+v_2)$ 会得到四项 $\beta(u_1,v_1)+\beta(u_1,v_2)+\beta(u_2,v_1)+\beta(u_2,v_2)$——就像 $(a+b)(c+d)$ 的展开,而不是两项。例如 $\mathbf F$ 上的 $\beta(x,y)=xy$:$\beta(2,2)=4$,而「线性」会要求它等于 $2\beta(1,1)=2$。事实上,既是双线性型又是 $V\times V$ 上线性泛函的只有 $\beta=0$(习题 9A.3)。
逐槽线性:冻住一个输入,另一个输入就是线性泛函

拖动红色向量 $u$ 和蓝色向量 $v$ 的箭头尖。图中的平行直线是线性泛函 $x\mapsto\beta(u,x)$ 的等值线(线旁数字为函数值):$v$ 落在哪条线上,$\beta(u,v)$ 就是多少。切换「冻住 $v$」可看另一个槽 $x\mapsto\beta(x,v)$。

沿着一条等值线拖动 $v$,$\beta(u,v)$ 不变;把 $u$ 加倍,等值线间距减半(所有值都翻倍)——这就是「第一个槽线性」。选「交错」型时,$u$ 自己总是躺在 0 号线上($\beta(u,u)=0$),而「交换 $u$ 与 $v$」会让值变号;选「对称」或「内积」时交换不改变值。

和算子一样,双线性型的全体也构成向量空间,并且取定一组基后可以用矩阵记录。

定义$V^{(2)}$9.3

$V$ 上全体双线性型的集合记作 $V^{(2)}$。按函数通常的加法与数乘,$V^{(2)}$ 是向量空间。

定义双线性型的矩阵 $\mathcal M(\beta)$matrix of a bilinear form9.4

设 $\beta$ 是 $V$ 上的双线性型,$e_1,\dots,e_n$ 是 $V$ 的基。$\beta$ 关于这组基的矩阵是 $n\times n$ 矩阵 $\mathcal M(\beta)$,其第 $j$ 行第 $k$ 列为

$$\mathcal M(\beta)_{j,k}=\beta(e_j,e_k).$$

需要强调基时写 $\mathcal M\big(\beta,(e_1,\dots,e_n)\big)$。

直觉:矩阵 = 基向量两两配对的「取值表」 把 $u=\sum_j x_je_j$、$v=\sum_k y_ke_k$ 代进去,逐槽展开:$\beta(u,v)=\sum_j\sum_k x_jy_k\,\beta(e_j,e_k)=x^{\mathrm t}\,\mathcal M(\beta)\,y$。所以 $\beta$ 被 $n^2$ 个数 $\beta(e_j,e_k)$ 完全确定,反过来任意 $n^2$ 个数也确定一个双线性型——这就是下面 9.5 的全部内容。
定理$\dim V^{(2)}=(\dim V)^2$9.5

设 $e_1,\dots,e_n$ 是 $V$ 的基,则 $\beta\mapsto\mathcal M(\beta)$ 是 $V^{(2)}$ 到 $\mathbf F^{n,n}$ 的同构。因此 $\dim V^{(2)}=(\dim V)^2$。

证明思路

$\beta\mapsto\mathcal M(\beta)$ 显然线性。反方向,对 $A\in\mathbf F^{n,n}$ 定义 $\beta_A(\sum x_je_j,\sum y_ke_k)=\sum_{j,k}A_{j,k}x_jy_k$。可以验证 $\beta_{\mathcal M(\beta)}=\beta$、$\mathcal M(\beta_A)=A$,两个线性映射互逆,于是两边维数相同:$\dim V^{(2)}=\dim\mathbf F^{n,n}=n^2$。

算子可以「塞进」双线性型的某个槽里,得到新的双线性型。它们的矩阵关系如下——注意左槽出现了转置。

命题双线性型与算子的复合composition of a bilinear form and an operator9.6

设 $\beta\in V^{(2)}$,$T\in\mathcal L(V)$,定义 $\alpha(u,v)=\beta(u,Tv)$,$\rho(u,v)=\beta(Tu,v)$。则对任意一组基

$$\mathcal M(\alpha)=\mathcal M(\beta)\,\mathcal M(T),\qquad \mathcal M(\rho)=\mathcal M(T)^{\mathrm t}\,\mathcal M(\beta).$$
证明思路

用坐标一眼看穿:记 $A=\mathcal M(\beta)$,$M=\mathcal M(T)$,则 $\beta(x,Ty)=x^{\mathrm t}A(My)=x^{\mathrm t}(AM)y$,而 $\beta(Tx,y)=(Mx)^{\mathrm t}Ay=x^{\mathrm t}(M^{\mathrm t}A)y$。原书逐个元素计算:$\mathcal M(\alpha)_{j,k}=\beta(e_j,Te_k)=\beta\big(e_j,\sum_m\mathcal M(T)_{m,k}e_m\big)=\sum_m\beta(e_j,e_m)\mathcal M(T)_{m,k}$。

定理换基公式change-of-basis formula9.7

设 $\beta\in V^{(2)}$,$e_1,\dots,e_n$ 与 $f_1,\dots,f_n$ 都是 $V$ 的基。令 $A=\mathcal M\big(\beta,(e_1,\dots,e_n)\big)$,$B=\mathcal M\big(\beta,(f_1,\dots,f_n)\big)$,$C=\mathcal M\big(I,(e_1,\dots,e_n),(f_1,\dots,f_n)\big)$($C$ 的第 $k$ 列是 $e_k$ 在基 $f$ 下的坐标)。则

$$A=C^{\mathrm t}BC.$$
证明思路

坐标版:若 $x$ 是某向量在基 $e$ 下的坐标,则它在基 $f$ 下的坐标是 $Cx$。于是 $\beta$ 在两组坐标下的值 $(Cx)^{\mathrm t}B(Cy)=x^{\mathrm t}(C^{\mathrm t}BC)y$,所以 $A=C^{\mathrm t}BC$。

原书版:取算子 $T$ 使 $Tf_k=e_k$,则 $\mathcal M(T,(f))=C$。令 $\alpha(u,v)=\beta(u,Tv)$、$\rho(u,v)=\alpha(Tu,v)=\beta(Tu,Tv)$,则 $\beta(e_j,e_k)=\rho(f_j,f_k)$,于是由 9.6 两次:$A=\mathcal M(\rho,(f))=C^{\mathrm t}\mathcal M(\alpha,(f))=C^{\mathrm t}BC$。

为什么是 $C^{\mathrm t}$ 而不是 $C^{-1}$? 回忆算子的换基公式(3.84)是 $A=C^{-1}BC$:输入要先换坐标(右乘 $C$),输出是向量,还得换回原来的坐标(左乘 $C^{-1}$)。双线性型的两个输入都要换坐标(左右各一个 $C$,左边那个以转置出现),而输出是一个数,数没有坐标,不用换回。一句话:算子是「一进一出」,双线性型是「两进零出」。
算子 $T\in\mathcal L(V)$双线性型 $\beta\in V^{(2)}$
矩阵的第 $(j,k)$ 元$Te_k$ 的第 $j$ 个坐标$\beta(e_j,e_k)$
换基公式$C^{-1}BC$(3.84)$C^{\mathrm t}BC$(9.7)
「矩阵对称」这件事依赖于基的选取与基无关:要么总对称,要么总不对称(9.12)
能否化为对角矩阵不一定(如幂零算子)对称型一定能(9.12)
例$\mathcal P_2(\mathbf R)$ 上一个双线性型的矩阵the matrix of a bilinear form on 𝒫₂(𝐑)9.8

在 $\mathcal P_2(\mathbf R)$ 上定义 $\beta(p,q)=p(2)\cdot q'(3)$。令 $A=\mathcal M\big(\beta,(1,\,x-2,\,(x-3)^2)\big)$,$B=\mathcal M\big(\beta,(1,x,x^2)\big)$,$C=\mathcal M\big(I,(1,x-2,(x-3)^2),(1,x,x^2)\big)$。则

$$A=\begin{pmatrix}0 & 1 & 0\\ 0 & 0 & 0\\ 0 & 1 & 0\end{pmatrix},\quad B=\begin{pmatrix}0 & 1 & 6\\ 0 & 2 & 12\\ 0 & 4 & 24\end{pmatrix},\quad C=\begin{pmatrix}1 & -2 & 9\\ 0 & 1 & -6\\ 0 & 0 & 1\end{pmatrix},$$

用矩阵乘法可以验证 $A=C^{\mathrm t}BC$。

怎么算出来的?(顺便看到一个「秩一」结构)

$B_{j,k}=e_j(2)\cdot e_k'(3)$。基 $1,x,x^2$ 在 2 处的值是 $(1,2,4)$,导数在 3 处的值是 $(0,1,6)$,所以 $B$ 的每个元素都是「行因子 × 列因子」:$B=(1,2,4)^{\mathrm t}(0,1,6)$。同理,基 $1,\,x-2,\,(x-3)^2$ 在 2 处的值是 $(1,0,1)$,导数在 3 处的值是 $(0,1,0)$,所以 $A=(1,0,1)^{\mathrm t}(0,1,0)$。$C$ 的三列是 $1,\ x-2,\ x^2-6x+9$ 在基 $1,x,x^2$ 下的系数。

这类「$\varphi(u)\tau(v)$ 型」的双线性型的矩阵总是一个列向量乘一个行向量——9D 会把它叫作张量积 $\varphi\otimes\tau$ 的「秩一矩阵」。

换一组基:同一个双线性型,矩阵变成 CᵗBC

拖动新基向量 $e_1$(红)、$e_2$(蓝),青色斜网格是新坐标网格。读数里 $\mathcal M(\beta,(e_1,e_2))$ 的四个数就是 $\beta(e_j,e_k)$,它恰等于 $C^{\mathrm t}BC$;灰色是「错用算子公式」$C^{-1}BC$ 的结果。细曲线是 $\beta(x,x)=\pm1$;紫色虚线是 $\{x:\beta(e_1,x)=0\}$——把 $e_2$ 拖到它上面,矩阵的 $(1,2)$ 元就变成 0。两个「对角化」按钮在学完下面的 9.12、9.13 后再点。

对称的 $B$ 换到任何基下都还是对称矩阵,而 $C^{-1}BC$ 通常不对称——这就是表格里说的「对称性与基无关」。「按 9.12」得到的对角化基一般不正交;「按 9.13」用的是规范正交的特征向量,这时 $C$ 是正交矩阵,$C^{\mathrm t}=C^{-1}$,两个公式给出同一个对角矩阵。选「交错」型试试:无论怎么换基,矩阵总是 $\begin{pmatrix}0 & c\\ -c & 0\end{pmatrix}$,而且 $c$ 恰好等于 $\det C$——这是 9B、9C 的伏笔。

在 $\mathbf R^2$ 中把基向量 $e_1$ 换成 $2e_1$($e_2$ 不变)。双线性型 $\beta$ 的矩阵的 $(1,1)$ 元会怎样?

对称双线性型 Symmetric Bilinear Forms

内积最重要的性质之一是对称。这一小节说明:对称双线性型的矩阵在任何基下都对称,而且总能找到一组基让它变成对角矩阵——这是二次型能化成「平方和」的根本原因。

定义对称双线性型,$V^{(2)}_{\mathrm{sym}}$symmetric bilinear form9.9

双线性型 $\rho\in V^{(2)}$ 称为对称的,如果对所有 $u,w\in V$ 都有 $\rho(u,w)=\rho(w,u)$。$V$ 上对称双线性型的集合记作 $V^{(2)}_{\mathrm{sym}}$。

例对称双线性型symmetric bilinear forms9.10
  • 实内积空间上 $\rho(u,w)=\langle u,w\rangle$。
  • 实内积空间上 $\rho(u,w)=\langle u,Tw\rangle$:它对称当且仅当 $T$ 是自伴算子(上一条是 $T=I$ 的特例)。
  • $\mathcal L(V)$ 上 $\rho(S,T)=\operatorname{tr}(ST)$:迹是线性泛函,且 $\operatorname{tr}(ST)=\operatorname{tr}(TS)$(8.56)。
定义对称矩阵symmetric matrix9.11

方阵 $A$ 称为对称矩阵,如果它等于自己的转置:$A=A^{\mathrm t}$。

一个算子可能在某些基下矩阵对称、在另一些基下不对称;双线性型则是「全有或全无」:

定理对称双线性型可对角化symmetric bilinear forms are diagonalizable9.12

设 $\rho\in V^{(2)}$。以下四条等价:

(a) $\rho$ 是对称双线性型;
(b) 对 $V$ 的每一组基,$\mathcal M(\rho)$ 都是对称矩阵;
(c) 对 $V$ 的某一组基,$\mathcal M(\rho)$ 是对称矩阵;
(d) 对 $V$ 的某一组基,$\mathcal M(\rho)$ 是对角矩阵。

证明思路

(a)⇒(b):$\rho(e_j,e_k)=\rho(e_k,e_j)$。(b)⇒(c) 显然。(c)⇒(a):展开 $\rho(u,w)=\sum_{j,k}a_jb_k\rho(e_j,e_k)$,利用矩阵对称把 $\rho(e_j,e_k)$ 换成 $\rho(e_k,e_j)$,就得到 $\rho(w,u)$。(d)⇒(c):对角矩阵是对称的。

关键是 (a)⇒(d),对 $n=\dim V$ 归纳:$n=1$ 时 $1\times1$ 矩阵自然是对角的。设 $n\gt1$ 且 $\rho\neq0$,取 $u,w$ 使 $\rho(u,w)\neq0$。由恒等式

$$2\rho(u,w)=\rho(u+w,u+w)-\rho(u,u)-\rho(w,w)$$

右边三项不能全为 0,所以存在 $v$ 使 $\rho(v,v)\neq0$。令 $U=\{u\in V:\rho(u,v)=0\}$,它是非零线性泛函 $u\mapsto\rho(u,v)$ 的零空间,故 $\dim U=n-1$。由归纳假设,$U$ 有基 $e_1,\dots,e_{n-1}$ 使 $\rho|_{U\times U}$ 的矩阵对角。因为 $v\notin U$,$e_1,\dots,e_{n-1},v$ 是 $V$ 的基;又 $\rho(e_k,v)=0=\rho(v,e_k)$,所以这组基下的矩阵是对角的。

直觉:用 ρ 代替内积做「正交化」 证明里的 $U=\{u:\rho(u,v)=0\}$ 就是「与 $v$ 关于 $\rho$ 正交」的向量。整个构造像是 Gram–Schmidt:先挑一个 $\rho(v,v)\neq0$ 的向量,再在它的「$\rho$-正交补」里继续。回到上面的换基演示点「按 9.12 构造对角化」:$e_1$ 保持不动,$e_2$ 被移到紫色虚线 $\{x:\rho(e_1,x)=0\}$ 上,矩阵立刻变成对角的——而 $e_1,e_2$ 在通常意义下一般并不垂直。

如果 $V$ 恰好还是实内积空间(这个内积与 $\rho$ 毫无关系),对角化的基还可以选成规范正交的:

定理用规范正交基对角化对称双线性型diagonalization of a symmetric bilinear form by an orthonormal basis9.13

设 $V$ 是实内积空间,$\rho$ 是 $V$ 上的对称双线性型。则 $\rho$ 关于 $V$ 的某个规范正交基有对角矩阵。

证明思路

取规范正交基 $f_1,\dots,f_n$,$B=\mathcal M(\rho,(f))$ 是对称矩阵(9.12)。让 $T$ 是以 $B$ 为矩阵的算子,它自伴。实谱定理(7.29)给出规范正交基 $e_1,\dots,e_n$ 使 $T$ 的矩阵 $C^{-1}BC$ 对角,其中 $C=\mathcal M(I,(e),(f))$。关键一步:$C$ 是实的酉矩阵,所以 $C^{-1}=C^{\mathrm t}$(7.57),于是 $\mathcal M(\rho,(e))=C^{\mathrm t}BC=C^{-1}BC$ 是对角的。

常见误区 9.13 的证明依赖「$C^{\mathrm t}=C^{-1}$」,而复酉矩阵满足的是 $C^{-1}=\overline{C}^{\mathrm t}$,不是 $C^{\mathrm t}$。所以去掉 $\mathbf F=\mathbf R$ 这个假设,证明就走不通(习题 9A.7)。

与对称相对的是「交错」。交错型会在 9B、9C 扮演主角。

定义交错双线性型,$V^{(2)}_{\mathrm{alt}}$alternating bilinear form9.14

双线性型 $\alpha\in V^{(2)}$ 称为交错的,如果对所有 $v\in V$ 都有 $\alpha(v,v)=0$。$V$ 上交错双线性型的集合记作 $V^{(2)}_{\mathrm{alt}}$。

例交错双线性型alternating bilinear forms9.15
  • $n\ge3$,$\mathbf F^n$ 上 $\alpha(x,y)=x_1y_2-x_2y_1+x_1y_3-x_3y_1$。
  • $\varphi,\tau\in V'$:$\alpha(u,w)=\varphi(u)\tau(w)-\varphi(w)\tau(u)$。
命题交错双线性型的刻画characterization of alternating bilinear forms9.16

双线性型 $\alpha$ 是交错的,当且仅当对所有 $u,w\in V$ 都有 $\alpha(u,w)=-\alpha(w,u)$。

证明思路

⇒:$0=\alpha(u+w,u+w)=\alpha(u,u)+\alpha(u,w)+\alpha(w,u)+\alpha(w,w)=\alpha(u,w)+\alpha(w,u)$。⇐:取 $u=w=v$ 得 $\alpha(v,v)=-\alpha(v,v)$,所以 $\alpha(v,v)=0$。

定理$V^{(2)}=V^{(2)}_{\mathrm{sym}}\oplus V^{(2)}_{\mathrm{alt}}$9.17

$V^{(2)}_{\mathrm{sym}}$ 与 $V^{(2)}_{\mathrm{alt}}$ 都是 $V^{(2)}$ 的子空间,并且 $V^{(2)}=V^{(2)}_{\mathrm{sym}}\oplus V^{(2)}_{\mathrm{alt}}$。

证明思路

对任意 $\beta$,令 $\rho(u,w)=\frac{\beta(u,w)+\beta(w,u)}2$、$\alpha(u,w)=\frac{\beta(u,w)-\beta(w,u)}2$,则 $\rho$ 对称、$\alpha$ 交错、$\beta=\rho+\alpha$。若 $\beta$ 既对称又交错,则 $\beta(u,w)=-\beta(w,u)=-\beta(u,w)$,故 $\beta=0$,交集为 $\{0\}$。

直觉:矩阵的「偶部」与「奇部」 在矩阵层面这就是 $A=\frac{A+A^{\mathrm t}}2+\frac{A-A^{\mathrm t}}2$:对称部分 + 反对称部分,完全类比「每个函数 = 偶函数 + 奇函数」。例如 $\begin{pmatrix}1 & 2\\ 0 & -1\end{pmatrix}=\begin{pmatrix}1 & 1\\ 1 & -1\end{pmatrix}+\begin{pmatrix}0 & 1\\ -1 & 0\end{pmatrix}$。

二次型 Quadratic Forms

把双线性型的两个输入取成同一个向量,就得到二次型。它是「二次齐次多项式」的无坐标说法,几何上对应椭圆、双曲线这些二次曲线。

定义与双线性型相伴的二次型 $q_\beta$quadratic form associated with a bilinear form9.18

对 $V$ 上的双线性型 $\beta$,定义 $q_\beta:V\to\mathbf F$ 为 $q_\beta(v)=\beta(v,v)$。函数 $q:V\to\mathbf F$ 称为 $V$ 上的二次型(quadratic form),如果存在双线性型 $\beta$ 使 $q=q_\beta$。

注意:$q_\beta=0$ 当且仅当 $\beta$ 是交错的——二次型「看不见」交错部分。

例二次型quadratic form9.19

$\mathbf R^3$ 上 $\beta(x,y)=x_1y_1-4x_1y_2+8x_1y_3-3x_3y_3$,则 $q_\beta(x)=x_1^2-4x_1x_2+8x_1x_3-3x_3^2$。

命题$\mathbf F^n$ 上的二次型quadratic forms on 𝐅ⁿ9.20

函数 $q:\mathbf F^n\to\mathbf F$ 是二次型,当且仅当存在数 $A_{j,k}\in\mathbf F$ 使 $q(x_1,\dots,x_n)=\sum_{k=1}^n\sum_{j=1}^nA_{j,k}x_jx_k$——也就是「二次齐次多项式」。

证明思路

⇒:取 $A$ 为 $\beta$ 在标准基下的矩阵,$q(x)=\beta(x,x)=\sum A_{j,k}x_jx_k$。⇐:用同一个 $A$ 定义 $\beta(x,y)=\sum A_{j,k}x_jy_k$,则 $q=q_\beta$。

同一个二次型可以来自许多不同的双线性型(加上任意交错型都不变)。但如果只允许对称的,那就唯一了:

定理二次型的刻画characterizations of quadratic forms9.21

设 $q:V\to\mathbf F$ 是函数。以下四条等价:

(a) $q$ 是二次型;
(b) 存在唯一的对称双线性型 $\rho$ 使 $q=q_\rho$;
(c) 对所有 $\lambda\in\mathbf F$、$v\in V$ 有 $q(\lambda v)=\lambda^2q(v)$,且 $(u,w)\mapsto q(u+w)-q(u)-q(w)$ 是对称双线性型;
(d) 对所有 $v$ 有 $q(2v)=4q(v)$,且 $(u,w)\mapsto q(u+w)-q(u)-q(w)$ 是对称双线性型。

证明思路

(a)⇒(b):由 9.17 写 $\beta=\rho+\alpha$,则 $q=q_\beta=q_\rho+q_\alpha=q_\rho$;若另有对称 $\rho'$ 使 $q_{\rho'}=q$,则 $\rho'-\rho$ 既对称又(因 $q_{\rho'-\rho}=0$)交错,只能为 0。(b)⇒(c):$q(\lambda v)=\lambda^2\rho(v,v)$,且 $q(u+w)-q(u)-q(w)=2\rho(u,w)$。(c)⇒(d) 显然。(d)⇒(a):令 $\rho(u,w)=\frac{q(u+w)-q(u)-q(w)}2$,则 $\rho(v,v)=\frac{q(2v)-2q(v)}2=q(v)$。

直觉:极化恒等式把二次型「还原」成对称型 (b)(c) 背后是极化恒等式:$\rho(u,w)=\tfrac12\big[q(u+w)-q(u)-q(w)\big]$。只要知道每个向量的「长度平方」式的值 $q(v)$,就能反推出唯一的对称「内积」式的 $\rho$。在矩阵上,这就是把交叉项系数平分到对称的两个位置。
例与二次型相伴的对称双线性型symmetric bilinear form associated with a quadratic form9.22

对例 9.19 的 $q(x)=x_1^2-4x_1x_2+8x_1x_3-3x_3^2$,例 9.19 中的 $\beta$ 不对称;对称的那个是

$$\rho(x,y)=x_1y_1-2x_1y_2-2x_2y_1+4x_1y_3+4x_3y_1-3x_3y_3,\qquad \mathcal M(\rho)=\begin{pmatrix}1 & -2 & 4\\ -2 & 0 & 0\\ 4 & 0 & -3\end{pmatrix}.$$

交叉项 $-4x_1x_2$ 平分成 $-2x_1y_2-2x_2y_1$,$8x_1x_3$ 平分成 $4x_1y_3+4x_3y_1$。

最后是本节的收官结果:选对基,二次型里就没有交叉项 $x_jx_k\ (j\neq k)$,只剩平方的加权和。

定理二次型的对角化diagonalization of quadratic form9.23

设 $q$ 是 $V$ 上的二次型。

(a) 存在 $V$ 的基 $e_1,\dots,e_n$ 与 $\lambda_1,\dots,\lambda_n\in\mathbf F$,使对所有 $x_1,\dots,x_n\in\mathbf F$:

$$q(x_1e_1+\cdots+x_ne_n)=\lambda_1x_1^2+\cdots+\lambda_nx_n^2.$$

(b) 若 $\mathbf F=\mathbf R$ 且 $V$ 是内积空间,(a) 中的基可以取成规范正交基。

证明思路

由 9.21 取对称 $\rho$ 使 $q=q_\rho$;由 9.12 取基使 $\mathcal M(\rho)$ 对角,对角元记为 $\lambda_j$,即 $\rho(e_j,e_k)=\lambda_j$($j=k$)或 0($j\neq k$)。于是 $q(\sum x_je_j)=\sum_{j,k}x_jx_k\rho(e_j,e_k)=\sum_j\lambda_jx_j^2$。(b) 用 9.13 代替 9.12。

二次型的等高线:椭圆、双曲线与退化情形

用滑块设定对称矩阵 $\begin{pmatrix}a & b\\ b & c\end{pmatrix}$,即 $q(x)=ax_1^2+2bx_1x_2+cx_2^2$。蓝色曲线是 $q=1,2,4$,红色是 $q=-1,-2,-4$,细虚线是 $q=0$;青色长虚线是主轴(规范正交特征向量方向)。拖动橙色点 $x$,读数比较它在原坐标与主轴坐标下的 $q$ 值。

在主轴坐标 $(y_1,y_2)$ 下,交叉项消失,$q=\lambda_1y_1^2+\lambda_2y_2^2$——这就是 9.23(b)。两个 $\lambda$ 同号:等高线是椭圆;异号:双曲线,$q=0$ 是两条渐近线;有一个为 0:等高线退化成平行直线。把 $b$ 拉大,交叉项越强,主轴转得越明显。

补充(原书未讲):哪些东西不随基改变? 9.23 中的 $\lambda_1,\dots,\lambda_n$ 并不唯一:把 $e_k$ 换成 $ce_k$,$\lambda_k$ 就变成 $c^2\lambda_k$。但在 $\mathbf F=\mathbf R$ 时,$c^2\gt0$ 不会改变符号,而且可以证明:正的、负的、零的 $\lambda$ 各有几个与基的选取无关(Sylvester 惯性定律)。所以「椭圆型 / 双曲型 / 退化型」是二次型本身的性质,而不是坐标系的产物。

二次型 $q(x)=x_1^2+6x_1x_2+5x_2^2$ 对应的唯一对称双线性型的矩阵是哪个?

对称矩阵 $\begin{pmatrix}1 & 2\\ 2 & 1\end{pmatrix}$ 定义的二次型,其等高线 $q(x)=1$ 是什么形状?

双线性型bilinear form$\beta:V\times V\to\mathbf F$,固定任一个槽,另一个槽都是线性泛函。坐标下 $\beta(x,y)=x^{\mathrm t}Ay$。
双线性型的矩阵matrix of a bilinear form$\mathcal M(\beta)_{j,k}=\beta(e_j,e_k)$;换基公式 $A=C^{\mathrm t}BC$(9.7)。
对称双线性型symmetric bilinear form$\rho(u,w)=\rho(w,u)$;矩阵在每组基下都对称,且总有一组基使之对角(9.12)。
交错双线性型alternating bilinear form$\alpha(v,v)=0$ 对一切 $v$ 成立,等价于 $\alpha(u,w)=-\alpha(w,u)$(9.16)。
二次型quadratic form$q(v)=\beta(v,v)$;由唯一的对称双线性型决定(9.21),可化为 $\lambda_1x_1^2+\cdots+\lambda_nx_n^2$(9.23)。
对称矩阵symmetric matrix满足 $A=A^{\mathrm t}$ 的方阵;对称双线性型的矩阵。
本节要点
  • 双线性型 = 逐槽线性;取基后是矩阵 $\mathcal M(\beta)_{j,k}=\beta(e_j,e_k)$,$\dim V^{(2)}=n^2$。
  • 换基:$A=C^{\mathrm t}BC$(两进零出),对比算子的 $C^{-1}BC$(一进一出)。
  • $V^{(2)}=V^{(2)}_{\mathrm{sym}}\oplus V^{(2)}_{\mathrm{alt}}$;二次型只由对称部分决定。
  • 对称型总能对角化(9.12),实内积空间里还能用规范正交基(9.13)⟹ 二次型 = 平方的加权和(9.23)。

9B 交错多重线性型 Alternating Multilinear Forms

这一节把「两个输入」推广到「$m$ 个输入」。其中最要紧的是交错型:它们表现得就像「有向面积 / 有向体积」。本节的终点是 9.37:在 $n$ 维空间上,交错 $n$-线性型的全体只是一条「直线」(一维空间)——下一节对行列式的定义完全建立在这一点上。

多重线性型 Multilinear Forms

定义$V^m$9.24

对正整数 $m$,$V^m=\underbrace{V\times\cdots\times V}_{m\ \text{个}}$。

定义$m$-线性型,$V^{(m)}$,多重线性型m-linear form, multilinear form9.25
  • $V$ 上的 $m$-线性型(m-linear form)是函数 $\beta:V^m\to\mathbf F$,它在其余槽固定时对每个槽都线性:对每个 $k\in\{1,\dots,m\}$ 与所有 $u_1,\dots,u_m$,$v\mapsto\beta(u_1,\dots,u_{k-1},v,u_{k+1},\dots,u_m)$ 是 $V$ 到 $\mathbf F$ 的线性映射。
  • $V$ 上 $m$-线性型的集合记作 $V^{(m)}$(按函数的运算是向量空间)。
  • 若 $\beta$ 对某个正整数 $m$ 是 $m$-线性型,就称它为多重线性型(multilinear form)。

1-线性型就是线性泛函,2-线性型就是双线性型。

例$m$-线性型m-linear forms9.26
  • $\alpha,\rho\in V^{(2)}$,定义 $\beta(v_1,v_2,v_3,v_4)=\alpha(v_1,v_2)\,\rho(v_3,v_4)$,则 $\beta\in V^{(4)}$。
  • $\beta(T_1,\dots,T_m)=\operatorname{tr}(T_1\cdots T_m)$ 是 $\mathcal L(V)$ 上的 $m$-线性型。

多重线性型的空间很大(习题 9B.1:$\dim V^{(m)}=(\dim V)^m$),真正有用的是下面这一类:

定义交错型,$V^{(m)}_{\mathrm{alt}}$alternating forms9.27
  • $V$ 上的 $m$-线性型 $\alpha$ 称为交错的(alternating),如果只要列表 $v_1,\dots,v_m$ 中有两个向量相等($v_j=v_k$,$j\neq k$),就有 $\alpha(v_1,\dots,v_m)=0$。
  • $V^{(m)}_{\mathrm{alt}}=\{\alpha\in V^{(m)}:\alpha\ \text{是交错的}\}$,它是 $V^{(m)}$ 的子空间。
直觉:交错型 = 有向体积 在 $\mathbf R^2$ 中,$\alpha(u,v)=u_1v_2-u_2v_1$ 就是 $u,v$ 张成的平行四边形的有向面积:两个输入相同,平行四边形被压扁成线段,面积为 0——这正是「交错」。在 $\mathbf R^3$ 中,三个向量张成的平行六面体的有向体积也是交错 3-线性型。记住这幅图,本节的定理几乎都能「看出来」。
命题交错多重线性型与线性相关alternating multilinear forms and linear dependence9.28

设 $\alpha$ 是 $V$ 上的交错 $m$-线性型。若 $v_1,\dots,v_m$ 线性相关,则 $\alpha(v_1,\dots,v_m)=0$。

证明思路

由线性相关性引理(2.19),某个 $v_k=b_1v_1+\cdots+b_{k-1}v_{k-1}$。把它代入第 $k$ 个槽并按线性展开:每一项里都有某个 $v_j$ 出现了两次,所以每项都是 0。几何上:线性相关 = 平行六面体被压扁到更低维 = 体积为 0。

推论$m\gt\dim V$ 时没有非零交错 $m$-线性型no nonzero alternating m-linear forms for m > dim V9.29

若 $m\gt\dim V$,则 $V$ 上唯一的交错 $m$-线性型是 0。

证明思路

$m\gt\dim V$ 时任何 $m$ 个向量都线性相关(2.22),由 9.28 输出总是 0。几何上:平面里画不出有非零「体积」的平行六面体。

交错 2-型就是有向面积

拖动 $u$(红)与 $v$(蓝)的箭头尖。平行四边形的颜色表示 $\alpha(u,v)=c\,(u_1v_2-u_2v_1)$ 的符号:绿色为正(从 $u$ 逆时针转向 $v$),紫色为负。滑块 $t$ 把 $v$ 换成 $v+tu$(剪切,虚线为原图形);滑块 $c=\alpha(e_1,e_2)$ 选择「哪一个」交错 2-型。

四件事一目了然:(1) 交换 $u,v$,颜色翻转、值变号(9.30);(2) $v=u$ 或 $v$ 与 $u$ 共线,平行四边形被压扁,值为 0(9.27、9.28);(3) 剪切 $v\mapsto v+tu$ 不改变底和高,所以值不变——这正是「多重线性 + 交错」:$\alpha(u,v+tu)=\alpha(u,v)+t\,\alpha(u,u)=\alpha(u,v)$;(4) 读数里的四项展开说明:任何交错 2-型都等于 $\alpha(e_1,e_2)$ 乘同一个数 $u_1v_2-u_2v_1$——改变 $c$ 只是整体缩放。这就是 9.37「只有一维」的二维版本。

交错多重线性型与置换 Alternating Multilinear Forms and Permutations

「两个输入相同就得 0」这个看似温和的条件,会逼出一个强得多的结论:交换任意两个输入都会变号。

命题交换交错多重线性型的两个输入swapping input vectors in an alternating multilinear form9.30

设 $\alpha$ 是 $V$ 上的交错 $m$-线性型,$v_1,\dots,v_m\in V$。交换 $\alpha(v_1,\dots,v_m)$ 中任意两个槽里的向量,值乘以 $-1$。

证明思路

在前两个槽都放 $v_1+v_2$:$0=\alpha(v_1+v_2,v_1+v_2,v_3,\dots,v_m)$。按多重线性展开成四项,其中 $\alpha(v_1,v_1,\dots)$、$\alpha(v_2,v_2,\dots)$ 为 0,剩下 $\alpha(v_1,v_2,\dots)+\alpha(v_2,v_1,\dots)=0$(和 9.16 一模一样)。其他两个槽同理。

多次交换会怎样?例如对交错 3-线性型:交换第 1、3 槽得 $\alpha(v_3,v_1,v_2)=-\alpha(v_2,v_1,v_3)$,再交换第 1、2 槽得 $\alpha(v_3,v_1,v_2)=-\alpha(v_2,v_1,v_3)=\alpha(v_1,v_2,v_3)$。一般地:奇数次交换变号,偶数次交换不变。要把这件事说严格,需要一点置换的知识。

定义置换,$\operatorname{perm}m$permutation9.31
  • $(1,\dots,m)$ 的一个置换(permutation)是一个列表 $(j_1,\dots,j_m)$,其中 $1,\dots,m$ 每个数恰好出现一次。
  • $(1,\dots,m)$ 的全体置换记作 $\operatorname{perm}m$。例如 $(2,3,4,5,1)\in\operatorname{perm}5$。

把 $\operatorname{perm}m$ 的元素想成「前 $m$ 个正整数的一种重新排列」。

把一个置换还原成 $(1,\dots,m)$ 需要的交换次数取决于怎么换,并不唯一;但下面的定义给每个置换一个确定的符号:

定义置换的符号sign of a permutation9.32

置换 $(j_1,\dots,j_m)$ 的符号定义为 $\operatorname{sign}(j_1,\dots,j_m)=(-1)^N$,其中 $N$ 是满足 $1\le k\lt\ell\le m$ 且「$k$ 在列表中出现在 $\ell$ 之后」的整数对 $(k,\ell)$ 的个数(即逆序对的个数)。

也就是说:自然顺序被打乱了偶数次,符号为 $1$;奇数次,符号为 $-1$。

例符号signs9.33
  • $(1,\dots,m)$ 没有打乱任何顺序,符号为 $1$。
  • $(2,1,3,4)$ 中唯一的逆序对是 $(1,2)$,符号为 $-1$。
  • $(2,3,\dots,m,1)$ 中逆序对恰为 $(1,2),(1,3),\dots,(1,m)$,共 $m-1$ 个,符号为 $(-1)^{m-1}$。
命题交换置换中的两个元素swapping two entries in a permutation9.34

交换置换中的任意两个元素,置换的符号乘以 $-1$。

证明思路

只需证明逆序数的变化量是奇数。设交换 $a$ 与 $b$(不必相邻)。(1) $a,b$ 这一对本身:原来顺序对,现在就反了,反之亦然——变化 $\pm1$。(2) 夹在 $a,b$ 之间的每个元素 $x$:若 $x$ 原来与 $a,b$ 都成顺序,交换后与两者都成逆序(变化 $+2$);都成逆序则变化 $-2$;恰与一个成顺序则仍然如此(变化 0)——都是偶数。(3) 其余的对不受影响。总变化 = 奇数 + 偶数 = 奇数。

置换的符号:数逆序、看交叉

上排是置换 $(j_1,\dots,j_m)$,每个数用一条线连到下排它在自然顺序中的位置。两条线交叉一次 ⟺ 一个逆序对(交叉点用红点标出),所以逆序数 $N$ = 交叉点个数。点击上排任意两格交换它们;或按「排序一步」观察每次交换都让符号翻转。

无论交换哪两个元素(相邻或不相邻),逆序数都变化奇数个,符号必然翻转(9.34)。「排序一步」反复交换直到还原成 $(1,\dots,m)$:用掉的交换次数 $s$ 可以因策略不同而不同,但 $(-1)^s$ 总等于原置换的符号——这就是「交换次数的奇偶性是确定的」。

把 9.30 与 9.34 合起来:每交换一次输入,$\alpha$ 的值乘 $-1$,置换的符号也乘 $-1$。一路交换回自然顺序,就得到:

定理置换与交错多重线性型permutations and alternating multilinear forms9.35

设 $\alpha\in V^{(m)}_{\mathrm{alt}}$。则对 $V$ 中任意向量列表 $v_1,\dots,v_m$ 及任意 $(j_1,\dots,j_m)\in\operatorname{perm}m$:

$$\alpha(v_{j_1},\dots,v_{j_m})=\operatorname{sign}(j_1,\dots,j_m)\;\alpha(v_1,\dots,v_m).$$
证明思路

从 $(j_1,\dots,j_m)$ 出发,经过若干次交换回到 $(1,\dots,m)$。每次交换让 $\alpha$ 的值乘 $-1$(9.30),也让「剩下的置换」的符号乘 $-1$(9.34);终点 $(1,\dots,m)$ 的符号是 1。所以 $\alpha$ 的值变号的次数的奇偶性恰由 $\operatorname{sign}(j_1,\dots,j_m)$ 决定。

现在取 $m=n=\dim V$,把每个输入向量用一组基展开,就得到一个「漂亮的公式」:

定理$(\dim V)$-线性交错型的公式formula for (dim V)-linear alternating forms on V9.36

设 $n=\dim V$,$e_1,\dots,e_n$ 是 $V$ 的基,$v_1,\dots,v_n\in V$,并记 $v_k=\sum_{j=1}^nb_{j,k}e_j$。则对 $V$ 上每个交错 $n$-线性型 $\alpha$:

$$\alpha(v_1,\dots,v_n)=\alpha(e_1,\dots,e_n)\sum_{(j_1,\dots,j_n)\in\operatorname{perm}n}\operatorname{sign}(j_1,\dots,j_n)\,b_{j_1,1}\cdots b_{j_n,n}.$$
证明思路

见下面的步骤播放器:先把每个槽都展开($n^n$ 项),交错性让下标有重复的项全部消失,只剩 $n!$ 个下标互不相同的项,也就是置换;再用 9.35 把每个 $\alpha(e_{j_1},\dots,e_{j_n})$ 换成 $\operatorname{sign}(j_1,\dots,j_n)\,\alpha(e_1,\dots,e_n)$。

第 1 步:多重线性——把每个槽都展开

以 $n=3$ 为例。$v_1=\sum_{j_1}b_{j_1,1}e_{j_1}$,$v_2=\sum_{j_2}b_{j_2,2}e_{j_2}$,$v_3=\sum_{j_3}b_{j_3,3}e_{j_3}$。逐槽展开得

$\alpha(v_1,v_2,v_3)=\sum_{j_1=1}^3\sum_{j_2=1}^3\sum_{j_3=1}^3 b_{j_1,1}b_{j_2,2}b_{j_3,3}\;\alpha(e_{j_1},e_{j_2},e_{j_3})$,

一共 $3^3=27$ 项——下图每一格是一项,格中数字是下标 $j_1j_2j_3$。

第 2 步:交错——下标有重复的项全是 0

若 $j_1,j_2,j_3$ 中有两个相同,$\alpha(e_{j_1},e_{j_2},e_{j_3})$ 就有两个相同的输入,按定义为 0。27 项里有 21 项这样被划掉,只剩 $3!=6$ 项:下标恰好是 $(1,2,3)$ 的 6 个置换。

第 3 步:置换——剩下每项都是 ±α(e₁,e₂,e₃)

由 9.35,$\alpha(e_{j_1},e_{j_2},e_{j_3})=\operatorname{sign}(j_1,j_2,j_3)\,\alpha(e_1,e_2,e_3)$。图中绿色格符号为 $+$(逆序数为偶数),紫色格为 $-$(逆序数为奇数)。

第 4 步:结论——α 只由一个数决定

$\alpha(v_1,v_2,v_3)=\alpha(e_1,e_2,e_3)\times\big[\text{6 项带符号乘积之和}\big]$。方括号里的数只依赖于坐标 $b_{j,k}$,与 $\alpha$ 无关。所以任意两个交错 3-型 $\alpha,\alpha'$ 只差一个倍数 $\alpha'(e_1,e_2,e_3)/\alpha(e_1,e_2,e_3)$——它们构成的空间至多一维(9.37)。而方括号里那个与 $\alpha$ 无关的数,下一节会被认出来:它正是矩阵 $(b_{j,k})$ 的行列式(9.46)。

交错 3-线性型的展开:27 项 → 6 项(每一格的数字是下标 $j_1j_2j_3$)

下面是本节、也是整章的钥匙:

定理$\dim V^{(\dim V)}_{\mathrm{alt}}=1$9.37

向量空间 $V^{(\dim V)}_{\mathrm{alt}}$ 的维数是 1。

证明思路

至多一维:设 $n=\dim V$,$\alpha,\alpha'$ 是交错 $n$-线性型且 $\alpha\neq0$。取 $e_1,\dots,e_n$ 使 $\alpha(e_1,\dots,e_n)\neq0$,由 9.28 它们线性无关,因而是基。令 $c$ 满足 $\alpha'(e_1,\dots,e_n)=c\,\alpha(e_1,\dots,e_n)$,对任意 $v_1,\dots,v_n$ 两次使用 9.36 就得 $\alpha'(v_1,\dots,v_n)=c\,\alpha(v_1,\dots,v_n)$,即 $\alpha'=c\alpha$。

至少一维(存在非零的):取基 $e_1,\dots,e_n$ 及对偶基 $\varphi_1,\dots,\varphi_n$($v=\sum\varphi_j(v)e_j$,见 3.114),定义

$$\alpha(v_1,\dots,v_n)=\sum_{(j_1,\dots,j_n)\in\operatorname{perm}n}\operatorname{sign}(j_1,\dots,j_n)\,\varphi_{j_1}(v_1)\cdots\varphi_{j_n}(v_n).\qquad(9.38)$$

它显然是 $n$-线性的。交错:若 $v_1=v_2$,置换 $(j_1,j_2,j_3,\dots)$ 与 $(j_2,j_1,j_3,\dots)$ 符号相反而乘积相同,两两抵消。最后 $\alpha(e_1,\dots,e_n)=1$(只有恒等置换有贡献),所以 $\alpha\neq0$。公式 9.38 正是从 9.36「倒推」出来的。

为什么「一维」这么重要? 一维空间里的元素都是某一个非零元素的倍数。所以 $n$ 维空间上「度量有向体积」的方法本质上只有一种,不同的交错 $n$-型只是「体积单位」不同(相差一个常数倍)。下一节:算子 $T$ 把一个体积函数变成另一个体积函数,而在一维空间里它只能「乘以一个数」。
命题交错 $(\dim V)$-线性型与线性无关alternating (dim V)-linear forms and linear independence9.39

设 $n=\dim V$,$\alpha$ 是 $V$ 上非零的交错 $n$-线性型,$e_1,\dots,e_n\in V$。则 $\alpha(e_1,\dots,e_n)\neq0$ 当且仅当 $e_1,\dots,e_n$ 线性无关。

证明思路

⇒ 是 9.28 的逆否。⇐:线性无关且个数为 $n$,所以是基(2.38);$\alpha\neq0$,存在 $v_1,\dots,v_n$ 使 $\alpha(v_1,\dots,v_n)\neq0$;由 9.36 这个值等于 $\alpha(e_1,\dots,e_n)$ 乘某个数,故 $\alpha(e_1,\dots,e_n)\neq0$。

常见误区:9.39 需要「输入个数 = 维数」 在 $\mathbf R^3$ 上,$\alpha(x,y)=x_1y_2-x_2y_1$ 是非零的交错 2-线性型,但对线性无关的 $e_1,e_3$ 有 $\alpha(e_1,e_3)=0$(习题 9B.7)。几何上:它只量「投影到 $x_1x_2$ 平面上的有向面积」,而 $e_1,e_3$ 张成的平行四边形投影后被压扁了。

设 $\alpha$ 是交错 3-线性型,且 $\alpha(v_1,v_2,v_3)=5$。那么 $\alpha(v_3,v_1,v_2)$ 等于多少?

置换 $(2,5,1,4,3)$ 的符号是?

m-线性型m-linear form$\beta:V^m\to\mathbf F$,其余槽固定时对每个槽都线性;全体记作 $V^{(m)}$。
多重线性型multilinear form对某个正整数 $m$ 是 $m$-线性型的函数。
交错多重线性型alternating multilinear form有两个输入相同就输出 0;等价地,交换两个输入就变号;输入线性相关就输出 0。
置换permutation$1,\dots,m$ 的一个重新排列 $(j_1,\dots,j_m)$;全体记作 $\operatorname{perm}m$,共 $m!$ 个。
置换的符号sign of a permutation$(-1)^N$,$N$ 为逆序对个数;交换任意两个元素必使符号翻转(9.34)。
本节要点
  • 交错 = 两输入相同得 0 ⟹ 交换变号(9.30)⟹ 线性相关得 0(9.28)⟹ $m\gt\dim V$ 时只有 0(9.29)。
  • 置换的符号由逆序数定义,交换两个元素必翻转符号(9.34);于是 $\alpha(v_{j_1},\dots,v_{j_m})=\operatorname{sign}\cdot\alpha(v_1,\dots,v_m)$(9.35)。
  • 展开 + 交错 + 置换 ⟹ 交错 $n$-型由 $\alpha(e_1,\dots,e_n)$ 一个数决定,且非零的存在:$\dim V^{(n)}_{\mathrm{alt}}=1$(9.37)。

9C 行列式 Determinants

这一节要做两件事:先用 9.37「交错 $n$-型只有一维」给出行列式一个不依赖基的定义;再从这个定义出发,几乎不费力地推出行列式的全部重要性质——乘法性、可逆性判据、与特征值和体积的关系,以及特征多项式与 Cayley–Hamilton 定理。

定义行列式 Defining the Determinant

定义$\alpha_T$9.40

设 $m$ 为正整数,$T\in\mathcal L(V)$。对 $\alpha\in V^{(m)}_{\mathrm{alt}}$,定义 $\alpha_T\in V^{(m)}_{\mathrm{alt}}$ 为

$$\alpha_T(v_1,\dots,v_m)=\alpha(Tv_1,\dots,Tv_m).$$

$\alpha_T$ 确实是交错的:若 $v_j=v_k$,则 $Tv_j=Tv_k$,于是 $\alpha(Tv_1,\dots,Tv_m)=0$。并且 $\alpha\mapsto\alpha_T$ 是 $V^{(m)}_{\mathrm{alt}}$ 到自身的线性映射。当 $m=\dim V$ 时,这个空间是一维的(9.37),而一维空间到自身的线性映射只能是「乘以某个唯一确定的数」——

定义算子的行列式 $\det T$determinant of an operator9.41

设 $T\in\mathcal L(V)$。$T$ 的行列式(determinant) $\det T$ 定义为 $\mathbf F$ 中唯一的数,使得

$$\alpha_T=(\det T)\,\alpha\qquad\text{对所有 }\alpha\in V^{(\dim V)}_{\mathrm{alt}}.$$
直觉:行列式 = 带符号的体积缩放倍数 把 $\alpha$ 想成「量有向体积的尺子」。$\alpha_T(v_1,\dots,v_n)=\alpha(Tv_1,\dots,Tv_n)$ 是 $v_1,\dots,v_n$ 张成的平行六面体经 $T$ 作用后的有向体积。定义说:这个值总是原来有向体积的 $\det T$ 倍——无论选哪个平行六面体,也无论用哪把「尺子」$\alpha$(它们只差常数倍,常数两边约掉)。所以 $\det T$ 是 $T$ 本身的属性,定义里根本没有出现基。
行列式的定义:T 把每一个有向面积都乘以同一个数

左图(窄屏时在上方):拖动 $u$(红)、$v$(蓝),$\alpha(u,v)=c\,(u_1v_2-u_2v_1)$ 是它们张成的平行四边形的有向面积(乘以「单位」$c$)。右图(窄屏时在下方):拖动空心点 $Te_1$、$Te_2$ 来设定算子 $T$(它们就是 $T$ 的矩阵的两列),彩色平行四边形由 $Tu,Tv$ 张成,其有向面积是 $\alpha_T(u,v)=\alpha(Tu,Tv)$。绿色 = 逆时针定向,紫色 = 顺时针定向。

随便拖动 $u,v$、改变 $c$,比值 $\alpha_T(u,v)/\alpha(u,v)$ 纹丝不动,永远等于 $ad-bc$——这就是「$\alpha_T=(\det T)\alpha$ 对所有 $\alpha$ 成立」的含义。点「特征向量」:$Tu=\lambda_1u$、$Tv=\lambda_2v$,两条边分别被拉伸 $\lambda_1,\lambda_2$ 倍,面积被放大 $\lambda_1\lambda_2$ 倍(9.42 最后一条)。选「反射」颜色翻转($\det\lt0$);选「奇异」像被压成线段($\det=0$)。

例算子的行列式determinants of operators9.42

设 $n=\dim V$。

  • 恒等算子:$\alpha_I=\alpha$,所以 $\det I=1$。
  • $\lambda\in\mathbf F$:每个槽都提出一个 $\lambda$,$\alpha_{\lambda I}=\lambda^n\alpha$,所以 $\det(\lambda I)=\lambda^n$。
  • 更一般地,$\alpha_{\lambda T}=\lambda^n\alpha_T=\lambda^n(\det T)\alpha$,所以 $\det(\lambda T)=\lambda^n\det T$。
  • 若 $V$ 有由 $T$ 的特征向量组成的基 $e_1,\dots,e_n$,对应特征值 $\lambda_1,\dots,\lambda_n$,则 $\alpha_T(e_1,\dots,e_n)=\alpha(\lambda_1e_1,\dots,\lambda_ne_n)=(\lambda_1\cdots\lambda_n)\,\alpha(e_1,\dots,e_n)$;取 $\alpha\neq0$,由 9.39 有 $\alpha(e_1,\dots,e_n)\neq0$,所以 $\det T=\lambda_1\cdots\lambda_n$。

矩阵的行列式则通过「对应的算子」来定义:

定义矩阵的行列式 $\det A$determinant of a matrix9.43

设 $A$ 是元素属于 $\mathbf F$ 的 $n\times n$ 方阵,$T\in\mathcal L(\mathbf F^n)$ 是在标准基下矩阵为 $A$ 的算子。定义 $\det A=\det T$。

例矩阵的行列式determinants of matrices9.44
  • $n\times n$ 单位矩阵对应恒等算子,所以其行列式为 1。
  • 对角元为 $\lambda_1,\dots,\lambda_n$ 的对角矩阵:标准基就是特征向量,所以 $\det A=\lambda_1\cdots\lambda_n$。

把 $\mathbf F^n$ 中的向量看作列向量,记 $\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}$ 为第 $k$ 列是 $v_k$ 的方阵。

命题行列式是交错多重线性型determinant is an alternating multilinear form9.45

映射 $v_1,\dots,v_n\ \mapsto\ \det\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}$ 是 $\mathbf F^n$ 上的交错 $n$-线性型。

证明思路

设 $T$ 满足 $Te_k=v_k$,则 $T$ 的矩阵就是 $\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}$。取交错 $n$-型 $\alpha$ 使 $\alpha(e_1,\dots,e_n)=1$,则 $\det\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}=\det T=(\det T)\,\alpha(e_1,\dots,e_n)=\alpha(Te_1,\dots,Te_n)=\alpha(v_1,\dots,v_n)$。所以「由列求行列式」这个函数就是那个满足 $\alpha(e_1,\dots,e_n)=1$ 的交错型。

马上得到:有两列相同的矩阵行列式为 0。更重要的是,把 9.36 用在这个 $\alpha$ 上,就得到行列式的显式公式:

定理矩阵行列式的公式formula for determinant of a matrix9.46

设 $A$ 是 $n\times n$ 方阵,则

$$\det A=\sum_{(j_1,\dots,j_n)\in\operatorname{perm}n}\operatorname{sign}(j_1,\dots,j_n)\,A_{j_1,1}\cdots A_{j_n,n}.$$
证明思路

在 9.36 中取 $V=\mathbf F^n$、标准基、$\alpha$ 为 9.45 的「由列求行列式」,$v_k$ 为 $A$ 的第 $k$ 列,于是 $b_{j,k}=A_{j,k}$,且 $\alpha(e_1,\dots,e_n)=\det I=1$。这正是上一节步骤播放器里「与 $\alpha$ 无关的那个数」。

例行列式的显式公式explicit formula for determinant9.47
  • $2\times2$:$\det A=A_{1,1}A_{2,2}-A_{2,1}A_{1,2}$。
  • $3\times3$:$\det A=A_{1,1}A_{2,2}A_{3,3}-A_{2,1}A_{1,2}A_{3,3}-A_{3,1}A_{2,2}A_{1,3}-A_{1,1}A_{3,2}A_{2,3}+A_{3,1}A_{1,2}A_{2,3}+A_{2,1}A_{3,2}A_{1,3}$。

公式 9.46 有 $n!$ 项。$10!$ 已超过三百万,$100!\approx10^{158}$,最快的计算机也算不完——所以它是理论工具,不是计算方法(计算方法见下面的高斯消元)。

3×3 行列式:6 项之和 = 平行六面体的有向体积

矩阵 $A$ 的三列 $v_1,v_2,v_3$(红、橙、蓝箭头)张成三维图中的平行六面体——在三维图中拖动可旋转视角。另一幅图列出公式 9.46 的 $3!=6$ 项:每一项从每一列各取一个元素,且所取元素的行互不相同(就像在棋盘上放 3 个互不攻击的「车」)。点击某一项,矩阵中对应的三个元素会高亮。在下方输入框里修改矩阵元素。

矩阵 A

选「上三角」:6 项里只有对角线那一项非零——其余每一项都至少取到一个对角线下方的 0(这就是 9.48 的证明)。选「交换前两列」:6 项整体变号,平行六面体的定向由右手系变为左手系(颜色由绿变紫)。选「第三列 = 前两列之和」:平行六面体被压扁成平面,6 项之和恰好为 0(9.28)。

命题上三角矩阵的行列式determinant of upper-triangular matrix9.48

若 $A$ 是上三角矩阵,对角元为 $\lambda_1,\dots,\lambda_n$,则 $\det A=\lambda_1\cdots\lambda_n$。

证明思路

若置换 $(j_1,\dots,j_n)\neq(1,\dots,n)$,则必有某个 $k$ 使 $j_k\gt k$(否则由「$j_k\le k$ 对所有 $k$」逐个推出 $j_k=k$),于是 $A_{j_k,k}$ 位于对角线下方,等于 0。所以 9.46 中只有恒等置换一项可能非零,它就是 $\lambda_1\cdots\lambda_n$。

行列式的性质 Properties of Determinants

无坐标定义的威力在这里集中体现。先看 Axler 所说的「魔法般的证明」:

定理行列式是乘性的determinant is multiplicative9.49

(a) 设 $S,T\in\mathcal L(V)$,则 $\det(ST)=(\det S)(\det T)$。
(b) 设 $A,B$ 是同阶方阵,则 $\det(AB)=(\det A)(\det B)$。

证明(三行)

(a) 设 $n=\dim V$,$\alpha\in V^{(n)}_{\mathrm{alt}}$,$v_1,\dots,v_n\in V$。则

$$\alpha_{ST}(v_1,\dots,v_n)=\alpha(STv_1,\dots,STv_n)=(\det S)\,\alpha(Tv_1,\dots,Tv_n)=(\det S)(\det T)\,\alpha(v_1,\dots,v_n).$$

第二个等号把 $Tv_k$ 看作输入、用 $\det S$ 的定义;第三个等号用 $\det T$ 的定义。所以 $\det(ST)=(\det S)(\det T)$。(b) 取 $\mathcal M(S)=A$、$\mathcal M(T)=B$,则 $\mathcal M(ST)=AB$(3.43),用 (a) 即可。

直觉:体积缩放倍数相乘 先用 $T$ 把一切体积放大 $\det T$ 倍,再用 $S$ 放大 $\det S$ 倍,总共放大 $(\det S)(\det T)$ 倍。注意 $ST\neq TS$ 很常见,但 $\det(ST)=\det(TS)$ 永远成立——两个数的乘积可以交换。
det(ST) = det S · det T:面积缩放倍数相乘

灰色虚线是单位正方形(面积 1)。拖动蓝色箭头 $Te_1$、$Te_2$ 设定 $T$,蓝色平行四边形是 $T$ 作用后的像;再选一个 $S$,红色是继续作用 $S$ 之后的像,即 $ST$ 作用于单位正方形。勾选「改看 TS」则先作用 $S$(绿色)再作用 $T$。

红色图形的有向面积总等于「蓝色面积 × det S」。勾选 TS:矩阵 $ST$ 与 $TS$ 一般不同(读数里可以看到),两个红色图形形状也不同,但面积与定向完全一样。选「S = T⁻¹」:红色回到单位正方形,$1=\det I=\det(T^{-1})\det T$——这就是下面的 9.50。

定理可逆 ⟺ 行列式非零invertible ⟺ nonzero determinant9.50

算子 $T\in\mathcal L(V)$ 可逆当且仅当 $\det T\neq0$。并且 $T$ 可逆时 $\det(T^{-1})=\dfrac1{\det T}$。

证明思路

⇒:$1=\det I=\det(TT^{-1})=(\det T)(\det T^{-1})$。⇐:设 $\det T\neq0$,$v\neq0$。把 $v$ 扩充成基 $v,e_2,\dots,e_n$,取非零 $\alpha$,由 9.39 $\alpha(v,e_2,\dots,e_n)\neq0$,于是 $\alpha(Tv,Te_2,\dots,Te_n)=(\det T)\,\alpha(v,e_2,\dots,e_n)\neq0$,故 $Tv\neq0$(否则有一个输入为 0,值为 0)。所以 $T$ 单射,从而可逆。

方阵 $A$ 可逆当且仅当对应的算子可逆,所以方阵可逆当且仅当 $\det A\neq0$。

推论特征值与行列式eigenvalues and determinants9.51

设 $T\in\mathcal L(V)$,$\lambda\in\mathbf F$。则 $\lambda$ 是 $T$ 的特征值当且仅当 $\det(\lambda I-T)=0$。

证明思路

$\lambda$ 是特征值 ⟺ $T-\lambda I$ 不可逆(5.7)⟺ $\lambda I-T$ 不可逆 ⟺ $\det(\lambda I-T)=0$(9.50)。

命题行列式是相似不变量determinant is a similarity invariant9.52

设 $T\in\mathcal L(V)$,$S:W\to V$ 是可逆线性映射。则 $\det(S^{-1}TS)=\det T$。

证明思路(为什么不能直接用 9.49?)

若 $W=V$,直接 $\det(S^{-1})\det T\det S=\det T$。但 $W\neq V$ 时 $S$ 不是算子,$\det S$ 无定义。绕开的办法:对 $\tau\in W^{(n)}_{\mathrm{alt}}$,定义 $V$ 上的 $\alpha(v_1,\dots,v_n)=\tau(S^{-1}v_1,\dots,S^{-1}v_n)$,则

$\tau_{S^{-1}TS}(w_1,\dots,w_n)=\alpha(TSw_1,\dots,TSw_n)=(\det T)\,\alpha(Sw_1,\dots,Sw_n)=(\det T)\,\tau(w_1,\dots,w_n)$。

定理算子的行列式等于其矩阵的行列式determinant of operator equals determinant of its matrix9.53

设 $T\in\mathcal L(V)$,$e_1,\dots,e_n$ 是 $V$ 的任意一组基,则 $\det T=\det\mathcal M\big(T,(e_1,\dots,e_n)\big)$。

证明思路

令 $S:\mathbf F^n\to V$ 把标准基 $f_k$ 送到 $e_k$。则 $\mathcal M(S^{-1}TS,(f))=\mathcal M(T,(e))$(9.54),于是 $\det T=\det(S^{-1}TS)=\det\mathcal M(S^{-1}TS,(f))=\det\mathcal M(T,(e))$,分别用了 9.52、矩阵行列式的定义、9.54。

左边与基无关,所以右边也与基无关:同一个算子在任何基下的矩阵,行列式都相同。

下面这个结果给出比定义或 9.46 更直观的理解;在复向量空间上,甚至可以把它当作行列式的定义:

定理$\mathbf F=\mathbf C$ 时,行列式等于特征值之积if F = C, then determinant equals product of eigenvalues9.55

设 $\mathbf F=\mathbf C$,$T\in\mathcal L(V)$。则 $\det T$ 等于 $T$ 的全部特征值之积,每个特征值按其重数计入。

证明思路

存在一组基,使 $T$ 的矩阵是上三角的,且对角线恰为各特征值(按重数重复,8.37)。由 9.53 与 9.48,$\det T$ 就是对角元之积。

定理转置、对偶与伴随的行列式determinant of transpose, dual, or adjoint9.56

(a) 方阵 $A$:$\det A^{\mathrm t}=\det A$。
(b) $T\in\mathcal L(V)$:$\det T'=\det T$。
(c) $V$ 为内积空间,$T\in\mathcal L(V)$:$\det(T^*)=\overline{\det T}$。

证明思路

(a) 令 $\alpha(v_1,\dots,v_n)=\det\big(\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}^{\mathrm t}\big)$。由 9.46 它是 $n$-线性的;若 $v_j=v_k$,则 $\begin{pmatrix}v_1 & \cdots & v_n\end{pmatrix}^{\mathrm t}$ 有两行相等,不可逆,值为 0——所以它是交错的。它在标准基上等于 1,而交错 $n$-型只有一维(9.37),所以它就是行列式函数。(b) 由 (a)、9.53 与 3.132($T'$ 的矩阵是 $T$ 的矩阵的转置)。(c) 规范正交基下 $T^*$ 的矩阵是共轭转置(7.9),再用 9.53、9.46 与 (a)。

命题计算行列式的实用结论helpful results in evaluating determinants9.57

(a) 方阵有两列(或两行)相等,则行列式为 0。
(b) 交换方阵的两列(或两行),行列式变号。
(c) 某一列(或一行)乘以常数,行列式也乘以该常数。
(d) 把某一列的常数倍加到另一列,行列式不变。
(e) 把某一行的常数倍加到另一行,行列式不变。

证明思路

全部来自「由列求行列式」与「由列求转置的行列式」都是交错 $n$-线性型(9.45、9.56(a))。例如 (d):$\det\begin{pmatrix}v_1+cv_2 & v_2 & \cdots & v_n\end{pmatrix}=\det\begin{pmatrix}v_1 & v_2 & \cdots & v_n\end{pmatrix}+c\det\begin{pmatrix}v_2 & v_2 & \cdots & v_n\end{pmatrix}$,最后一项有两列相同,为 0。几何上就是「剪切不改变体积」。(e) 由 (d) 与 9.56(a)。

对于具体的数值矩阵,9.57 给出比 9.46 快得多的算法:用高斯消元化成上三角矩阵,一路记下「交换了几次行」和「哪一行乘了什么数」,最后用 9.48 取对角元之积。

第 0 步:目标

计算 $A=\begin{pmatrix}0 & 2 & 4\\ 1 & 1 & 1\\ 2 & 4 & 3\end{pmatrix}$ 的行列式。策略:只用「交换两行」和「某行加上另一行的倍数」把它化成上三角,并跟踪每一步对行列式的影响。

第 1 步:交换第 1、2 行

第 1 列的主元位置是 0,先和第 2 行交换。由 9.57(b),行列式变号:$\det A=-\det(\text{新矩阵})$。

第 2 步:第 3 行减去 2 × 第 1 行

由 9.57(e),行列式不变。第 1 列主元下方已清零。

第 3 步:第 3 行减去 1 × 第 2 行

行列式仍然不变。现在矩阵是上三角的。

第 4 步:读出答案

上三角矩阵的行列式是对角元之积(9.48):$1\cdot2\cdot(-3)=-6$。再把第 1 步的变号算回去:$\det A=-(-6)=6$。可以用 9.47 的六项公式验算:$0-2\cdot(1\cdot3-1\cdot2)+4\cdot(1\cdot4-1\cdot2)=6$。

高斯消元的每一步对行列式的影响(高亮行为本步改动的行)
常见误区:用 det(λI − A) = 0 求特征值很少是好办法 9.51 让人想「求 $\det(\lambda I-A)$ 再解方程」。但除了 $\dim V=2$(或愿意用三次、四次求根公式时的 3、4 维),这很少高效:一是高斯消元要不断判断某个量是否为 0,含符号 $\lambda$ 时这种判断变得复杂;二是高次多项式没有求根公式。实际计算特征值用的是完全不同的数值方法。

回忆:酉算子保持范数,其特征值的绝对值都是 1(7.54),所以(至少在 $\mathbf C$ 上)它的行列式绝对值为 1。下面的证明对 $\mathbf R$ 同样有效:

命题酉算子的行列式绝对值为 1every unitary operator has determinant with absolute value 19.58

设 $V$ 是内积空间,$S\in\mathcal L(V)$ 是酉算子,则 $|\det S|=1$。

证明思路

$S^*S=I$(7.53),所以 $1=\det(S^*S)=(\det S^*)(\det S)=\overline{\det S}\,(\det S)=|\det S|^2$,用了 9.49(a) 与 9.56(c)。

命题正算子的行列式非负every positive operator has nonnegative determinant9.59

设 $V$ 是内积空间,$T\in\mathcal L(V)$ 是正算子,则 $\det T\ge0$。

证明思路

谱定理(7.29 或 7.31)给出由特征向量组成的规范正交基,于是 $\det T$ 是特征值之积(9.42 最后一条),而正算子的特征值都非负(7.38)。这与「正算子 ↔ 非负实数」的类比完全吻合。

定理$|\det T|$ = 奇异值之积|det T| = product of singular values of T9.60

设 $V$ 是内积空间,$T\in\mathcal L(V)$,则 $|\det T|=\sqrt{\det(T^*T)}=T$ 的奇异值之积。

证明思路

$|\det T|^2=\overline{\det T}\,\det T=\det(T^*)\det T=\det(T^*T)$。$T^*T$ 有由特征向量组成的规范正交基,特征值为 $s_1^2,\dots,s_n^2$(奇异值的平方),所以 $\det(T^*T)=s_1^2\cdots s_n^2$,开方即得。

算子作用于 $\mathbf R^n$ 中的集合时,体积按奇异值之积缩放(7.111),结合 9.60 立刻得到:

定理$T$ 使体积乘以 $|\det T|$T changes volume by factor of |det T|9.61

设 $T\in\mathcal L(\mathbf R^n)$,$\Omega\subseteq\mathbf R^n$。则 $\operatorname{volume}T(\Omega)=|\det T|\,(\operatorname{volume}\Omega)$。

联系:多元微积分的换元公式 9.61 解释了为什么换元积分公式里出现的是雅可比行列式的绝对值:局部地看,可微映射近似于一个线性映射,它把一小块区域的体积放大 $|\det|$ 倍;符号只关乎定向,不影响体积。例如椭球 $x^2/a^2+y^2/b^2+z^2/c^2\lt1$ 是单位球在 $\operatorname{diag}(a,b,c)$ 下的像,体积为 $abc\cdot\frac43\pi$(习题 9C.17)。

最后回到特征多项式。在复空间上,第 8 章用特征值及其重数定义了它(8.26);现在它有了一个在实空间上也适用的定义:

定理$\mathbf F=\mathbf C$ 时特征多项式等于 $\det(zI-T)$if F = C, then characteristic polynomial of T equals det(zI − T)9.62

设 $\mathbf F=\mathbf C$,$T\in\mathcal L(V)$,$\lambda_1,\dots,\lambda_m$ 是 $T$ 的互不相同的特征值,重数分别为 $d_1,\dots,d_m$。则

$$\det(zI-T)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}.$$
证明思路

取使 $T$ 的矩阵为上三角、每个 $\lambda_k$ 在对角线上恰出现 $d_k$ 次的基(8.37)。则 $zI-T$ 的矩阵也是上三角,对角元为 $z-\lambda_k$(各 $d_k$ 次),用 9.48。

定义特征多项式characteristic polynomial9.63

设 $T\in\mathcal L(V)$。多项式 $z\mapsto\det(zI-T)$ 称为 $T$ 的特征多项式(characteristic polynomial)。

由 9.46,它是次数为 $\dim V$ 的首一多项式;由 9.51,它在 $\mathbf F$ 中的零点恰好是 $T$ 的特征值。以前实空间上没法定义特征多项式(算子可能没有特征值),现在不再有这个障碍;而 9.62 说明新定义在 $\mathbf C$ 上与旧定义(8.26)一致。

定理Cayley–Hamilton 定理Cayley–Hamilton theorem9.64

设 $T\in\mathcal L(V)$,$q$ 是 $T$ 的特征多项式,则 $q(T)=0$。

证明思路

$\mathbf F=\mathbf C$ 时由 9.62 与 8.29 即得。$\mathbf F=\mathbf R$ 时,取一组基,令 $A$ 为 $T$ 的矩阵,$S$ 为 $\mathbf C^{\dim V}$ 上矩阵为 $A$ 的算子(把实矩阵「看成」复矩阵)。对实数 $z$ 有 $q(z)=\det(zI-T)=\det(zI-A)=\det(zI-S)$,所以 $q$ 也是 $S$ 的特征多项式;由复情形 $0=q(S)$,即 $q(A)=0$,从而 $q(T)=0$。

由 Cayley–Hamilton 定理,特征多项式是极小多项式的多项式倍(5.29);若极小多项式的次数等于 $\dim V$,两者就相等——这对绝大多数算子成立(例如元素取自 $[-100,100]$ 的整数 $4\times4$ 矩阵中超过 99.999%)。

定理特征多项式、迹与行列式characteristic polynomial, trace, and determinant9.65

设 $T\in\mathcal L(V)$,$n=\dim V$。则 $T$ 的特征多项式可写成

$$z^n-(\operatorname{tr}T)\,z^{n-1}+\cdots+(-1)^n\det T.$$
证明思路

常数项 = 在 $z=0$ 处的值 $=\det(-T)=(-1)^n\det T$(9.42 第三条)。$z^{n-1}$ 的系数:在 9.46 中,恒等置换贡献 $(z-A_{1,1})\cdots(z-A_{n,n})$,其 $z^{n-1}$ 系数是 $-(A_{1,1}+\cdots+A_{n,n})=-\operatorname{tr}T$;其他置换至多含 $n-2$ 个形如 $z-A_{k,k}$ 的因子,不影响 $z^{n-1}$ 项。

特征多项式 p(z) = det(zI − A) 与 Cayley–Hamilton

用滑块设定 $2\times2$ 实矩阵 $A=\begin{pmatrix}a & b\\ c & d\end{pmatrix}$。蓝色抛物线是 $p(z)=\det(zI-A)=z^2-(\operatorname{tr}A)\,z+\det A$:它与横轴的交点是实特征值(9.51),与纵轴的交点是 $p(0)=\det A$,对称轴在 $z=\operatorname{tr}A/2$。读数里直接验证 $p(A)=0$。

$\det A=p(0)$ 与特征值之积、$\operatorname{tr}A$ 与特征值之和的关系在图上一目了然。点「旋转 90°」:抛物线整个浮在横轴上方,没有实特征值,此时必有 $\det A=p(0)\gt0$(习题 9C.8);反过来,只要 $\det A\lt0$,$p(0)\lt0$,抛物线一定两次穿过横轴,给出两个不同的实特征值(习题 9C.9)。

下面两个经典结果展示了「在矩阵与线性映射之间切换」的威力。第一个由 Jacques Hadamard(1865–1963)于 1893 年证明:

定理Hadamard 不等式Hadamard’s inequality9.66

设 $A$ 是 $n\times n$ 矩阵,列为 $v_1,\dots,v_n$(范数取 $\mathbf F^n$ 的标准内积),则

$$|\det A|\le\prod_{k=1}^n\|v_k\|.$$
证明思路

$A$ 不可逆时左边为 0。设 $A$ 可逆,由 QR 分解(7.58)$A=QR$,$Q$ 为酉矩阵,$R$ 为对角元为正的上三角矩阵。于是 $|\det A|=|\det Q|\,|\det R|=|\det R|=\prod_kR_{k,k}\le\prod_k\|R_{\cdot,k}\|=\prod_k\|QR_{\cdot,k}\|=\prod_k\|v_k\|$,依次用了 9.49(b)、9.58、9.48、「一个坐标不超过整个向量的范数」、$Q$ 是等距。

‖v₁‖ = 2 ‖v₂‖ = 1.5 高 = 1.5·sin 50° ≈ 1.15 夹角 50°:面积 ≈ 2 × 1.15 = 2.30 ‖v₁‖ = 2 ‖v₂‖ = 1.5 正交时面积最大 = 2 × 1.5 = 3
Hadamard 不等式的几何意义(按比例绘制):两边长度固定时,夹角为直角的平行四边形面积最大;高维情形同理

几何解释($\mathbf F=\mathbf R$):令 $T$ 满足 $Te_k=v_k$,它把单位立方体 $P(e_1,\dots,e_n)$ 映成平行六面体 $P(v_1,\dots,v_n)$,由 9.61 后者体积为 $|\det T|=|\det A|$。所以 Hadamard 不等式说:在所有边长为 $\|v_1\|,\dots,\|v_n\|$ 的平行六面体中,边两两正交的体积最大(等号成立的条件见习题 9C.18)。上面的 3×3 演示读数里也给出了这个上界。

第二个是 Vandermonde 矩阵的行列式。它在多项式插值、离散傅里叶变换等领域都很重要:

定理Vandermonde 矩阵的行列式determinant of Vandermonde matrix9.67

设 $n\gt1$,$\beta_1,\dots,\beta_n\in\mathbf F$。则

$$\det\begin{pmatrix}1 & \beta_1 & \beta_1^2 & \cdots & \beta_1^{n-1}\\ 1 & \beta_2 & \beta_2^2 & \cdots & \beta_2^{n-1}\\ \vdots & & & \ddots & \vdots\\ 1 & \beta_n & \beta_n^2 & \cdots & \beta_n^{n-1}\end{pmatrix}=\prod_{1\le j\lt k\le n}(\beta_k-\beta_j).$$
证明思路(在矩阵与线性映射之间切换)

设 $S:\mathcal P_{n-1}(\mathbf F)\to\mathbf F^n$,$Sp=(p(\beta_1),\dots,p(\beta_n))$;Vandermonde 矩阵 $A$ 就是 $S$ 关于基 $1,z,\dots,z^{n-1}$ 与标准基的矩阵。再取算子 $T$:$T1=1$,$Tz^k=(z-\beta_1)\cdots(z-\beta_k)$。$T$ 的矩阵 $B$ 是对角元全为 1 的上三角矩阵,$\det B=1$。于是 $\det A=\det A\det B=\det C$,其中 $C$ 是 $ST$ 的矩阵,它的第 $k$ 列是 $(z-\beta_1)\cdots(z-\beta_{k-1})$ 在 $\beta_1,\dots,\beta_n$ 处的值——一个下三角矩阵,对角元为 $1,\ \beta_2-\beta_1,\ (\beta_3-\beta_1)(\beta_3-\beta_2),\ \dots$。由 9.56(a) 与 9.48,$\det C$ 就是这些对角元之积 $\prod_{j\lt k}(\beta_k-\beta_j)$。

例:n = 3 $\det\begin{pmatrix}1 & \beta_1 & \beta_1^2\\ 1 & \beta_2 & \beta_2^2\\ 1 & \beta_3 & \beta_3^2\end{pmatrix}=(\beta_2-\beta_1)(\beta_3-\beta_1)(\beta_3-\beta_2)$。取 $\beta=(1,2,4)$ 得 $1\cdot3\cdot2=6$。推论:$\beta_k$ 互不相同时行列式非零,所以「过 $n$ 个横坐标互不相同的点的次数 $\lt n$ 的插值多项式存在且唯一」。

设 $\dim V=3$,$\det T=5$。那么 $\det(2T)$ 等于?

设 $S,T\in\mathcal L(V)$ 且 $ST\neq TS$。关于 $\det(ST)$ 与 $\det(TS)$,哪个说法正确?

Axler 引用的一段话(Felix Klein) 「在我自己的初等课程里,出于教学的原因,我越来越把行列式推到幕后。我太多次地看到:学生熟练掌握了公式——它们确实能大大缩短冗长的表达式——却往往没有真正理解其含义;操作上的熟练反而妨碍了他们深入学科细节、真正掌握它。」——Felix Klein,《高观点下的初等数学:几何》。这正是本书把行列式放到最后、并且从「交错型」而不是从公式出发的原因。
行列式determinant满足 $\alpha_T=(\det T)\alpha$(对所有交错 $n$-型 $\alpha$)的唯一数:带符号的体积缩放倍数。
特征多项式characteristic polynomial$z\mapsto\det(zI-T)$:首一、次数 $\dim V$,零点是特征值,$=z^n-(\operatorname{tr}T)z^{n-1}+\cdots+(-1)^n\det T$。
Hadamard 不等式Hadamard’s inequality$|\det A|\le\prod_k\|v_k\|$($v_k$ 为列):边长给定时,正交的平行六面体体积最大。
Vandermonde 矩阵Vandermonde matrix第 $j$ 行为 $1,\beta_j,\dots,\beta_j^{n-1}$ 的矩阵,行列式 $\prod_{j\lt k}(\beta_k-\beta_j)$。
Cayley–Hamilton 定理Cayley–Hamilton theorem特征多项式 $q$ 满足 $q(T)=0$,实、复向量空间都成立(9.64)。
本节要点
  • 定义:$\alpha_T=(\det T)\alpha$,det = 带符号的体积缩放倍数;矩阵的行列式 = 对应算子的行列式,公式 9.46 有 $n!$ 项。
  • 乘法性 9.49 的证明只有三行;由它得到可逆 ⟺ $\det\neq0$、$\det T^{-1}=1/\det T$、相似不变、任何基下矩阵的行列式都相同。
  • $\mathbf C$ 上 det = 特征值之积;$\det A^{\mathrm t}=\det A$;酉算子 $|\det|=1$;正算子 $\det\ge0$;$|\det|$ = 奇异值之积 = 体积缩放倍数。
  • 特征多项式 $\det(zI-T)$ 对实、复空间都有定义,Cayley–Hamilton 定理从此对实空间成立;常数项 $(-1)^n\det T$,次高项系数 $-\operatorname{tr}T$。
  • 计算用高斯消元(9.57 + 9.48),不用 9.46。

9D 张量积 Tensor Products

这一节要回答:能不能让「向量乘向量」有意义?我们想要一个新空间 $V\otimes W$,里面有元素 $v\otimes w$(读作「$v$ 张量 $w$」),它像乘法一样满足分配律、能提出数乘,并且「基 × 基 = 基」。答案是可以的——而且在 $\mathbf F^m\otimes\mathbf F^n$ 里,$v\otimes w$ 就是熟悉的秩一矩阵 $vw^{\mathrm t}$。

两个向量空间的张量积 Tensor Product of Two Vector Spaces

先列出我们对「乘积」$v\otimes w$ 的愿望:

  • 分配律:$(v_1+v_2)\otimes w=v_1\otimes w+v_2\otimes w$,$v\otimes(w_1+w_2)=v\otimes w_1+v\otimes w_2$;
  • 数乘:$\lambda(v\otimes w)=(\lambda v)\otimes w=v\otimes(\lambda w)$;
  • 基 × 基 = 基:若 $e_1,\dots,e_m$ 是 $V$ 的基、$f_1,\dots,f_n$ 是 $W$ 的基,则所有 $e_j\otimes f_k$ 构成 $V\otimes W$ 的基——所以 $\dim(V\otimes W)$ 应当是 $(\dim V)(\dim W)$。

第 3 章的乘积空间 $V\times W$ 不合格:它的维数是 $\dim V+\dim W$(3.92),而且没有自然的方式把 $V$ 的元素与 $W$ 的元素「相乘」。为了自然地造出维数为 $(\dim V)(\dim W)$ 的空间,我们去看双线性泛函。

定义$V\times W$ 上的双线性泛函,$\mathcal B(V,W)$bilinear functional on V × W9.68
  • $V\times W$ 上的双线性泛函(bilinear functional)是函数 $\beta:V\times W\to\mathbf F$,使得对每个 $w\in W$,$v\mapsto\beta(v,w)$ 是 $V$ 上的线性泛函;对每个 $v\in V$,$w\mapsto\beta(v,w)$ 是 $W$ 上的线性泛函。
  • $V\times W$ 上双线性泛函的向量空间记作 $\mathcal B(V,W)$。

当 $W=V$ 时,这就是 9.1 的双线性型。

例双线性泛函bilinear functionals9.69
  • $\varphi\in V'$,$\tau\in W'$:$\beta(v,w)=\varphi(v)\tau(w)$ 是 $V\times W$ 上的双线性泛函。
  • $v\in V$,$w\in W$:$\beta(\varphi,\tau)=\varphi(v)\tau(w)$ 是 $V'\times W'$ 上的双线性泛函。(记住这个例子!)
  • $\beta(v,\varphi)=\varphi(v)$ 是 $V\times V'$ 上的双线性泛函。
  • $\varphi\in V'$:$\beta(v,T)=\varphi(Tv)$ 是 $V\times\mathcal L(V)$ 上的双线性泛函。
  • $\beta(A,B)=\operatorname{tr}(AB)$ 是 $\mathbf F^{m,n}\times\mathbf F^{n,m}$ 上的双线性泛函。
命题双线性泛函空间的维数dimension of the vector space of bilinear functionals9.70

$\dim\mathcal B(V,W)=(\dim V)(\dim W)$。

证明思路

与 9.5 一样:取基 $e_1,\dots,e_m$ 与 $f_1,\dots,f_n$,令 $\mathcal M(\beta)$ 为第 $j$ 行第 $k$ 列是 $\beta(e_j,f_k)$ 的 $m\times n$ 矩阵;反方向由矩阵 $C$ 定义 $\beta_C(\sum a_je_j,\sum b_kf_k)=\sum_{j,k}C_{j,k}a_jb_k$。两者互逆,所以 $\mathcal B(V,W)\cong\mathbf F^{m,n}$,维数 $mn$。

$\mathcal B(V,W)$、$\mathcal L(V,W)$、$\mathbf F^{\dim V,\dim W}$ 的维数都对,很容易想直接把 $V\otimes W$ 定义成其中之一。但它们都给不出一个不依赖基的 $v\otimes w$。Axler 的选择乍看有点怪,却恰好解决了这个问题:用对偶空间 $V'\times W'$ 上的双线性泛函。

定义张量积 $V\otimes W$,$v\otimes w$tensor product9.71
  • 张量积(tensor product) $V\otimes W$ 定义为 $\mathcal B(V',W')$。
  • 对 $v\in V$、$w\in W$,张量积 $v\otimes w$ 是 $V\otimes W$ 中的元素,定义为 $$(v\otimes w)(\varphi,\tau)=\varphi(v)\,\tau(w)\qquad\text{对所有 }(\varphi,\tau)\in V'\times W'.$$
直觉:$v\otimes w$ 是一台「读数相乘」的机器 $V\otimes W$ 的元素是一个函数:喂给它一对「测量仪」——$V$ 上的线性泛函 $\varphi$ 和 $W$ 上的线性泛函 $\tau$——它吐出一个数。$v\otimes w$ 的做法是:用 $\varphi$ 测 $v$、用 $\tau$ 测 $w$,把两个读数乘起来。这个定义里没有出现任何基。Axler 说得好:$v\otimes w$ 抽象的「身份」并不重要,重要的是它的行为(下面的 9.73、9.74)。
命题两个向量空间张量积的维数dimension of the tensor product of two vector spaces9.72

$\dim(V\otimes W)=(\dim V)(\dim W)$。

证明思路

$\dim V'=\dim V$、$\dim W'=\dim W$(3.111),再用 9.70。

命题张量积的双线性bilinearity of tensor product9.73

对 $v,v_1,v_2\in V$,$w,w_1,w_2\in W$,$\lambda\in\mathbf F$:

$$(v_1+v_2)\otimes w=v_1\otimes w+v_2\otimes w,\qquad v\otimes(w_1+w_2)=v\otimes w_1+v\otimes w_2,\qquad \lambda(v\otimes w)=(\lambda v)\otimes w=v\otimes(\lambda w).$$
证明思路

两边都作用在任意 $(\varphi,\tau)$ 上比较:$((v_1+v_2)\otimes w)(\varphi,\tau)=\varphi(v_1+v_2)\tau(w)=\varphi(v_1)\tau(w)+\varphi(v_2)\tau(w)=(v_1\otimes w+v_2\otimes w)(\varphi,\tau)$。其余同理。

定理$V\otimes W$ 的基basis of V ⊗ W9.74

设 $e_1,\dots,e_m$ 是 $V$ 中的向量组,$f_1,\dots,f_n$ 是 $W$ 中的向量组。

(a) 若两组都线性无关,则 $\{e_j\otimes f_k\}_{j=1,\dots,m;\,k=1,\dots,n}$ 在 $V\otimes W$ 中线性无关。
(b) 若两组分别是 $V$、$W$ 的基,则 $\{e_j\otimes f_k\}$ 是 $V\otimes W$ 的基。

证明思路

(a) 由线性无关与线性映射引理(3.4),取 $\varphi_1,\dots,\varphi_m\in V'$、$\tau_1,\dots,\tau_n\in W'$ 使 $\varphi_j(e_k)$、$\tau_j(f_k)$ 在 $j=k$ 时为 1、否则为 0(「对偶」测量仪)。若 $\sum_{j,k}a_{j,k}(e_j\otimes f_k)=0$(9.75),两边作用于 $(\varphi_M,\tau_N)$:左边只剩 $a_{M,N}$,所以每个 $a_{M,N}=0$。(b) 由 (a)、维数 9.72 以及「长度对的线性无关组是基」(2.38)。

这里的双下标列表不指定顺序,任选一种方便的排法即可。9.74(a) 说的是:$V\otimes W$ 中的向量之间,除了双线性(9.73)以及 $V$ 或 $W$ 中原有的线性相关带来的关系,没有别的关系。

常见误区:不是每个元素都形如 $v\otimes w$ 由 9.74(b),$V\otimes W$ 的每个元素都是若干个 $v\otimes w$ 之和;但当 $\dim V\gt1$ 且 $\dim W\gt1$ 时,并非每个元素都能写成单个 $v\otimes w$(习题 9D.4)。例如 $e_1\otimes f_1+e_2\otimes f_2$ 就不行——下面的矩阵图像会让这一点一目了然。
例$\mathbf F^m$ 的元素与 $\mathbf F^n$ 的元素的张量积tensor product of element of 𝐅ᵐ with element of 𝐅ⁿ9.76

设 $e_1,\dots,e_m$ 与 $f_1,\dots,f_n$ 分别是 $\mathbf F^m$、$\mathbf F^n$ 的标准基,$v=(v_1,\dots,v_m)$,$w=(w_1,\dots,w_n)$。由双线性,

$$v\otimes w=\Big(\sum_{j=1}^m v_je_j\Big)\otimes\Big(\sum_{k=1}^n w_kf_k\Big)=\sum_{k=1}^n\sum_{j=1}^m (v_jw_k)\,(e_j\otimes f_k).$$

所以 $v\otimes w$ 在基 $\{e_j\otimes f_k\}$ 下的系数是 $v_jw_k$。把它们排成 $m\times n$ 矩阵(第 $j$ 行第 $k$ 列放 $v_jw_k$),就把 $v\otimes w$ 等同于

$$\begin{pmatrix}v_1w_1 & \cdots & v_1w_n\\ \vdots & \ddots & \vdots\\ v_mw_1 & \cdots & v_mw_n\end{pmatrix}=v\,w^{\mathrm t}.$$
$v\otimes w$ 就是秩一矩阵:一张「乘法表」

左侧横条是 $v\in\mathbf R^3$ 的三个分量,上方竖条是 $w\in\mathbf R^4$ 的四个分量——直接拖动条形改变它们。中间 $3\times4$ 的格子是 $v\otimes w$ 在基 $\{e_j\otimes f_k\}$ 下的系数 $v_jw_k$(例 9.76):蓝色为正、红色为负,颜色越深绝对值越大。勾选「加上第二项」观察 $v\otimes w+v'\otimes w'$。

单独一项时,第 $j$ 行恰好是 $w$ 的 $v_j$ 倍,第 $k$ 列恰好是 $v$ 的 $w_k$ 倍——所有行都平行,所以秩 $\le1$(习题 9D.5:$\{v\otimes w\}$ 恰好是全体秩 $\le1$ 的矩阵)。拖动时注意 $\|v\otimes w\|=\|v\|\,\|w\|$ 始终成立(9.82 之后)。点「$v=0$」:整张表变成 0,$v\otimes w=0$(习题 9D.1)。加上第二项后,秩一般变成 2:它已经不能写成单个 $v\otimes w$ 了。

接下来,张量积的真正用途:把「双线性」问题转化成「线性」问题。先定义目标空间任意的双线性映射:

定义双线性映射bilinear map9.77

从 $V\times W$ 到向量空间 $U$ 的双线性映射(bilinear map)是函数 $\Gamma:V\times W\to U$,使得对每个 $w$,$v\mapsto\Gamma(v,w)$ 是 $V\to U$ 的线性映射;对每个 $v$,$w\mapsto\Gamma(v,w)$ 是 $W\to U$ 的线性映射。

例双线性映射bilinear maps9.78
  • $V\times W$ 上的每个双线性泛函都是到 $\mathbf F$ 的双线性映射。
  • $\Gamma(v,w)=v\otimes w$ 是 $V\times W\to V\otimes W$ 的双线性映射(9.73)。
  • $\Gamma(S,T)=ST$ 是 $\mathcal L(V)\times\mathcal L(V)\to\mathcal L(V)$ 的双线性映射。
  • $\Gamma(v,T)=Tv$ 是 $V\times\mathcal L(V,W)\to W$ 的双线性映射。
定理把双线性映射转化为线性映射converting bilinear maps to linear maps9.79

设 $U$ 是向量空间。

(a) 若 $\Gamma:V\times W\to U$ 是双线性映射,则存在唯一的线性映射 $\hat\Gamma:V\otimes W\to U$,使得对所有 $(v,w)$ 有 $\hat\Gamma(v\otimes w)=\Gamma(v,w)$。
(b) 反之,若 $T:V\otimes W\to U$ 是线性映射,则存在唯一的双线性映射 $T^{\#}:V\times W\to U$,使得 $T^{\#}(v,w)=T(v\otimes w)$。

数学文献中称 (a) 为张量积的泛性质(universal property)。

证明思路

(a) 取基 $e_j$、$f_k$。由线性映射引理与 9.74(b),存在唯一的线性映射 $\hat\Gamma$ 使 $\hat\Gamma(e_j\otimes f_k)=\Gamma(e_j,f_k)$。对 $v=\sum a_je_j$、$w=\sum b_kf_k$:$\hat\Gamma(v\otimes w)=\hat\Gamma\big(\sum a_jb_k\,e_j\otimes f_k\big)=\sum a_jb_k\,\Gamma(e_j,f_k)=\Gamma(v,w)$。唯一性来自 9.74(b)。(b) 令 $T^{\#}(v,w)=T(v\otimes w)$,由 9.73 与 $T$ 的线性即得双线性。

V × W U V ⊗ W Γ(双线性) (v, w) ↦ v ⊗ w (双线性,9.73) Γ(线性,唯一) Γ(v ⊗ w) = Γ(v, w)
对应原书 9.79 的「泛性质」:每个双线性映射 $\Gamma$ 都唯一地分解为「先做 $\otimes$,再做一个线性映射 $\hat\Gamma$」
为什么 9.79 需要证明? 很自然的想法是「令 $\hat\Gamma(v\otimes w)=\Gamma(v,w)$,再线性延拓」。问题在于 $V\otimes W$ 的元素写成若干 $v\otimes w$ 之和的方式不唯一(例如 $(2v)\otimes w=v\otimes(2w)$),这样「定义」可能自相矛盾。证明借助基绕开了这个问题;而等式 $\hat\Gamma(v\otimes w)=\Gamma(v,w)$ 又说明构造出来的 $\hat\Gamma$ 其实与基无关。用处:研究双线性映射 $V\times W\to U$ 等价于研究线性映射 $V\otimes W\to U$——我们熟悉的全部线性代数工具都可以用上了。

内积空间的张量积 Tensor Product of Inner Product Spaces

若 $V$、$W$ 都有内积,$V\otimes W$ 上也有一个自然的内积(下面对三个空间的内积用同一个记号 $\langle\cdot,\cdot\rangle$)。

定理两个内积空间张量积上的内积inner product on tensor product of two inner product spaces9.80

设 $V,W$ 是内积空间。则 $V\otimes W$ 上存在唯一的内积,使得对所有 $v,u\in V$、$w,x\in W$:

$$\langle v\otimes w,\ u\otimes x\rangle=\langle v,u\rangle\,\langle w,x\rangle.$$
证明思路

取规范正交基 $e_1,\dots,e_m$ 与 $f_1,\dots,f_n$,按系数定义内积(9.81):$\big\langle\sum b_{j,k}\,e_j\otimes f_k,\ \sum c_{j,k}\,e_j\otimes f_k\big\rangle=\sum_{j,k}b_{j,k}\overline{c_{j,k}}$。代入 $v=\sum v_je_j$ 等展开,得 $\sum_{j,k}v_j\overline{u_j}\,w_k\overline{x_k}=\big(\sum_jv_j\overline{u_j}\big)\big(\sum_kw_k\overline{x_k}\big)=\langle v,u\rangle\langle w,x\rangle$。唯一性:每个元素都是若干 $v\otimes w$ 的线性组合。

定义两个内积空间张量积上的内积inner product on tensor product of two inner product spaces9.82

$V\otimes W$ 上的内积是满足 $\langle v\otimes w,u\otimes x\rangle=\langle v,u\rangle\langle w,x\rangle$ 的那个唯一函数。

取 $u=v$、$x=w$ 再开方:$\|v\otimes w\|=\|v\|\,\|w\|$。在矩阵图像里,9.81 正是把矩阵当成长向量做内积 $\sum_{j,k}b_{j,k}\overline{c_{j,k}}$,于是 $\|v\otimes w\|$ 就是矩阵 $vw^{\mathrm t}$ 所有元素平方和的平方根——上面演示的读数里就在验证它。

命题$V\otimes W$ 的规范正交基orthonormal basis of V ⊗ W9.83

设 $V,W$ 是内积空间,$e_1,\dots,e_m$ 是 $V$ 的规范正交基,$f_1,\dots,f_n$ 是 $W$ 的规范正交基,则 $\{e_j\otimes f_k\}$ 是 $V\otimes W$ 的规范正交基。

证明思路

由 9.74(b) 它是基;而 $\langle e_j\otimes f_k,e_M\otimes f_N\rangle=\langle e_j,e_M\rangle\langle f_k,f_N\rangle$ 在 $j=M$ 且 $k=N$ 时为 1,否则为 0。要点:这里的规范正交基可以与 9.80 证明中用来构造内积的那组不同——所以内积确实与基的选取无关。

多个向量空间的张量积 Tensor Product of Multiple Vector Spaces

推广到多个空间不需要新想法,只是记号更繁。原书这一小节不给证明,读者可以仿照两个空间的情形补全。

注记号 $V_1,\dots,V_m$notation9.84

本小节中 $m$ 表示大于 1 的整数,$V_1,\dots,V_m$ 表示有限维向量空间。

定义$m$-线性泛函,$\mathcal B(V_1,\dots,V_m)$m-linear functional9.85

$V_1\times\cdots\times V_m$ 上的 $m$-线性泛函(m-linear functional)是其余槽固定时对每个槽都是线性泛函的函数 $\beta:V_1\times\cdots\times V_m\to\mathbf F$;它们构成的向量空间记作 $\mathcal B(V_1,\dots,V_m)$。(「$m$-线性型」是 $V_1=\cdots=V_m$ 的特例,见 9.25。)

例 9.86:若 $\varphi_k\in V_k'$,则 $\beta(v_1,\dots,v_m)=\varphi_1(v_1)\cdots\varphi_m(v_m)$ 是 $m$-线性泛函。仿照 9.70 可证 9.87:$\dim\mathcal B(V_1,\dots,V_m)=(\dim V_1)\cdots(\dim V_m)$。

定义张量积 $V_1\otimes\cdots\otimes V_m$,$v_1\otimes\cdots\otimes v_m$tensor product9.88
  • $V_1\otimes\cdots\otimes V_m$ 定义为 $\mathcal B(V_1',\dots,V_m')$。
  • 对 $v_k\in V_k$,$(v_1\otimes\cdots\otimes v_m)(\varphi_1,\dots,\varphi_m)=\varphi_1(v_1)\cdots\varphi_m(v_m)$。
定理维数与基dimension of the tensor product; basis of V₁ ⊗ ⋯ ⊗ Vₘ9.899.90

$\dim(V_1\otimes\cdots\otimes V_m)=(\dim V_1)\cdots(\dim V_m)$。若 $e^k_1,\dots,e^k_{n_k}$ 是 $V_k$ 的基,则 $\{e^1_{j_1}\otimes\cdots\otimes e^m_{j_m}\}_{j_1=1,\dots,n_1;\ \cdots;\ j_m=1,\dots,n_m}$ 是 $V_1\otimes\cdots\otimes V_m$ 的基。

当 $m=2$ 时,元素的系数排成一个矩阵(两个下标);当 $m\gt2$ 时,就需要一个带 $m$ 个下标的数组。这就是「张量」在数据科学、物理里常被说成「多维数组」的来由。

j = 1 j = 2 j = 3 第 1 张表:i = 1 u₁v₂w₃ 列 k = 1, …, 4 第 2 张表:i = 2 u₂v₂w₃ 列 k = 1, …, 4 u ⊗ v ⊗ w 的第 (i, j, k) 个系数 = uᵢ vⱼ wₖ
$\mathbf F^2\otimes\mathbf F^3\otimes\mathbf F^4$ 的元素 ↔ $2\times3\times4$ 的三下标数组(两张 $3\times4$ 表);纯张量 $u\otimes v\otimes w$ 的每个系数都是三个分量之积
定义$m$-线性映射m-linear map9.91

从 $V_1\times\cdots\times V_m$ 到向量空间 $U$ 的 $m$-线性映射(m-linear map)是在其余槽固定时对每个槽都线性的函数 $\Gamma:V_1\times\cdots\times V_m\to U$。

定理把 $m$-线性映射转化为线性映射converting m-linear maps to linear maps9.92

设 $U$ 是向量空间。(a) 若 $\Gamma:V_1\times\cdots\times V_m\to U$ 是 $m$-线性映射,则存在唯一的线性映射 $\hat\Gamma:V_1\otimes\cdots\otimes V_m\to U$ 使 $\hat\Gamma(v_1\otimes\cdots\otimes v_m)=\Gamma(v_1,\dots,v_m)$。(b) 反之,若 $T:V_1\otimes\cdots\otimes V_m\to U$ 线性,则存在唯一的 $m$-线性映射 $T^{\#}$ 使 $T^{\#}(v_1,\dots,v_m)=T(v_1\otimes\cdots\otimes v_m)$。

延伸:算子的张量积(习题 9D.9–9D.11) 若 $S\in\mathcal L(V)$、$T\in\mathcal L(W)$,则存在唯一的算子把 $v\otimes w$ 送到 $Sv\otimes Tw$,常记作 $S\otimes T$(证明正是用 9.79)。它可逆当且仅当 $S,T$ 都可逆,且 $(S\otimes T)^{-1}=S^{-1}\otimes T^{-1}$;在内积空间中 $(S\otimes T)^*=S^*\otimes T^*$。在矩阵层面,它就是常说的 Kronecker 积。

$\dim(\mathbf F^3\otimes\mathbf F^4)$ 与 $\dim(\mathbf F^3\times\mathbf F^4)$ 分别是多少?

双线性泛函bilinear functional$\beta:V\times W\to\mathbf F$,对两个槽分别线性;全体记作 $\mathcal B(V,W)$,维数 $(\dim V)(\dim W)$。
张量积tensor product$V\otimes W=\mathcal B(V',W')$;$(v\otimes w)(\varphi,\tau)=\varphi(v)\tau(w)$。在 $\mathbf F^m\otimes\mathbf F^n$ 中 $v\otimes w\leftrightarrow vw^{\mathrm t}$。
双线性映射bilinear map$\Gamma:V\times W\to U$,对每个槽都是线性映射(目标可以是任意向量空间)。
泛性质universal property每个双线性映射 $\Gamma$ 唯一对应一个线性映射 $\hat\Gamma:V\otimes W\to U$,$\hat\Gamma(v\otimes w)=\Gamma(v,w)$(9.79)。
m-线性泛函m-linear functional$V_1\times\cdots\times V_m\to\mathbf F$,每个槽都线性;全体 $\mathcal B(V_1,\dots,V_m)$ 的维数是各维数之积。
本节要点
  • $V\otimes W:=\mathcal B(V',W')$,$v\otimes w$ 把一对泛函的读数相乘;它是双线性的(9.73),基向量两两相乘得基(9.74),维数相乘(9.72)。
  • $\mathbf F^m\otimes\mathbf F^n\cong\mathbf F^{m,n}$:$v\otimes w\leftrightarrow vw^{\mathrm t}$(秩一),一般元素是秩一矩阵之和;不是每个元素都是单个 $v\otimes w$。
  • 泛性质:$V\times W$ 上的双线性映射 ↔ $V\otimes W$ 上的线性映射(9.79)。
  • 内积:$\langle v\otimes w,u\otimes x\rangle=\langle v,u\rangle\langle w,x\rangle$,$\|v\otimes w\|=\|v\|\|w\|$,规范正交基相乘得规范正交基。

本章小结

一条主线:逐槽线性 → 交错 → 置换符号 → 交错 $n$-型只有一维 → 行列式 = 算子在这条直线上的「倍数」 → 一切性质。

  • 9A 双线性型:$\beta(u,v)$ 逐槽线性;矩阵 $\mathcal M(\beta)_{j,k}=\beta(e_j,e_k)$,$\dim V^{(2)}=n^2$;换基 $A=C^{\mathrm t}BC$。$V^{(2)}=V^{(2)}_{\mathrm{sym}}\oplus V^{(2)}_{\mathrm{alt}}$;对称型总能对角化(9.12),实内积空间里可用规范正交基(9.13)。二次型 $q(v)=\beta(v,v)$ 由唯一的对称型决定(9.21),可写成 $\lambda_1x_1^2+\cdots+\lambda_nx_n^2$(9.23)。
  • 9B 交错多重线性型:两输入相同得 0 ⟹ 交换变号、线性相关得 0、$m\gt\dim V$ 时只有 0。置换的符号 $=(-1)^{\text{逆序数}}$,交换必翻转(9.34)。$\alpha(v_1,\dots,v_n)=\alpha(e_1,\dots,e_n)\sum\operatorname{sign}\cdot b_{j_1,1}\cdots b_{j_n,n}$(9.36)⟹ $\dim V^{(n)}_{\mathrm{alt}}=1$(9.37)。
  • 9C 行列式:$\alpha_T=(\det T)\alpha$(9.41)。由定义:$\det(ST)=\det S\det T$、可逆 ⟺ $\det\neq0$、$\det T=\det\mathcal M(T)$(任何基)、$\mathbf C$ 上为特征值之积、$\det A^{\mathrm t}=\det A$、$|\det T|$ = 奇异值之积 = 体积缩放倍数;特征多项式 $\det(zI-T)=z^n-(\operatorname{tr}T)z^{n-1}+\cdots+(-1)^n\det T$,Cayley–Hamilton 对实空间成立;Hadamard 不等式、Vandermonde 行列式。
  • 9D 张量积:$V\otimes W=\mathcal B(V',W')$,$(v\otimes w)(\varphi,\tau)=\varphi(v)\tau(w)$;双线性、基 × 基 = 基、维数相乘;$\mathbf F^m\otimes\mathbf F^n$ 中 $v\otimes w\leftrightarrow vw^{\mathrm t}$;泛性质:双线性映射 ↔ 线性映射;内积 $\langle v\otimes w,u\otimes x\rangle=\langle v,u\rangle\langle w,x\rangle$。

同一个空间,三种对象的「坐标记录」与换基规律($C$ 的第 $k$ 列是新基向量 $e_k$ 在旧基 $f$ 下的坐标):

对象取基后记录成换基后出处
算子 $T$(一进一出)方阵 $B=\mathcal M(T,(f))$$C^{-1}BC$3.84
双线性型 $\beta$(两进零出)方阵 $B=\mathcal M(\beta,(f))$$C^{\mathrm t}BC$9.7
交错 $n$-型 $\alpha$($n$ 进零出)一个数 $\alpha(f_1,\dots,f_n)$乘以 $\det C$9.36 / 9.46

乘积空间与张量积:

$V\times W$$V\otimes W$
维数$\dim V+\dim W$$\dim V\cdot\dim W$
典型元素$(v,w)$$v\otimes w$ 的和(一般不是单个 $v\otimes w$)
$(v,w)\mapsto$ 该元素线性双线性
$\mathbf F^m,\mathbf F^n$ 时的图像拼接成 $m+n$ 维向量$m\times n$ 矩阵($v\otimes w=vw^{\mathrm t}$ 秩一)

自测

设 $\dim V=3$。$V$ 上的交错 4-线性型有哪些?

$\mathbf R^2$ 上把向量旋转 90° 的算子 $T$ 没有实特征值。$\det T$ 的符号是?

Axler 能够不借助任何基定义 $\det T$,最关键的依据是什么?

在 $\mathbf F^2\otimes\mathbf F^2$ 中,$e_1\otimes e_1+e_2\otimes e_2$ 能写成单个 $v\otimes w$ 吗?

3×3 实矩阵的三列长度分别为 1、2、3。$|\det A|$ 最大可能是多少?

习题

以下习题选自原书 Exercises 9A–9D(编号与原书一致),建议先独立思考再展开提示与解答。

9A.1证明:若 $\beta$ 是 $\mathbf F$ 上的双线性型,则存在 $c\in\mathbf F$ 使得对所有 $x,y\in\mathbf F$ 有 $\beta(x,y)=cxy$。
提示$\mathbf F$ 是一维的,基是 $1$。把 $x$ 写成 $x\cdot1$,逐槽提出系数。
参考解答由第一个槽的线性,$\beta(x,y)=\beta(x\cdot1,y)=x\,\beta(1,y)$;再由第二个槽的线性,$\beta(1,y)=\beta(1,y\cdot1)=y\,\beta(1,1)$。令 $c=\beta(1,1)$,则 $\beta(x,y)=cxy$。(这与 9.5 一致:$\dim V^{(2)}=1^2=1$,每个双线性型由一个数 $\beta(1,1)$ 决定。)
9A.6证明或举反例:若 $\rho$ 是 $V$ 上的对称双线性型,则 $\{v\in V:\rho(v,v)=0\}$ 是 $V$ 的子空间。
提示回想二次型演示中「不定」情形的 $q=0$:它是两条相交直线。
参考解答命题一般不成立。反例:$V=\mathbf R^2$,$\rho(x,y)=x_1y_1-x_2y_2$(对称)。$u=(1,1)$、$w=(1,-1)$ 都满足 $\rho(u,u)=\rho(w,w)=0$,但 $u+w=(2,0)$ 满足 $\rho(u+w,u+w)=4\neq0$,所以该集合对加法不封闭。几何上,这个集合是两条直线 $x_2=\pm x_1$ 的并,不是子空间。(它在某些情形下是子空间,例如 $\rho=0$ 时是整个 $V$,$\rho$ 是内积时是 $\{0\}$,但不是普遍成立。)
9A.8用 $\dim V$ 给出 $\dim V^{(2)}_{\mathrm{sym}}$ 与 $\dim V^{(2)}_{\mathrm{alt}}$ 的公式。
提示取定一组基,用 9.5 的同构 $\beta\mapsto\mathcal M(\beta)$:对称型对应什么矩阵?交错型呢?
参考解答设 $n=\dim V$。在同构 $\beta\mapsto\mathcal M(\beta)$ 下,$V^{(2)}_{\mathrm{sym}}$ 恰好对应对称矩阵(9.12),它由对角线及其上方的元素自由决定,共 $\frac{n(n+1)}2$ 个,所以 $\dim V^{(2)}_{\mathrm{sym}}=\frac{n(n+1)}2$。$V^{(2)}_{\mathrm{alt}}$ 对应满足 $A^{\mathrm t}=-A$ 的矩阵(由 9.16,$\alpha(e_j,e_k)=-\alpha(e_k,e_j)$,特别地对角元 $\alpha(e_j,e_j)=0$;反之这样的矩阵给出满足 9.16 条件的双线性型),它由严格上三角部分自由决定,所以 $\dim V^{(2)}_{\mathrm{alt}}=\frac{n(n-1)}2$。检验:两者之和为 $n^2=\dim V^{(2)}$,与直和 9.17 一致。
9B.4证明或举反例:若 $\alpha\in V^{(4)}_{\mathrm{alt}}$,则 $\{(v_1,v_2,v_3,v_4)\in V^4:\alpha(v_1,v_2,v_3,v_4)=0\}$ 是 $V^4$ 的子空间。
提示分 $\alpha=0$ 与 $\alpha\neq0$ 两种情况。对后者,试着把一个「值非零」的输入拆成两个「值为零」的输入之和。
参考解答若 $\alpha=0$,该集合是整个 $V^4$,是子空间。若 $\alpha\neq0$,它不是子空间(所以命题一般不成立,例如 $\dim V=4$、$\alpha$ 取非零交错 4-型时)。取 $(v_1,v_2,v_3,v_4)$ 使 $\alpha(v_1,v_2,v_3,v_4)\neq0$。令 $x=(v_1,v_1,v_3,v_4)$(有两个相同输入,$\alpha(x)=0$),$y=(0,\,v_2-v_1,\,0,\,0)$(第一个输入为 0,$\alpha(y)=0$)。二者都在集合中,但 $x+y=(v_1,v_2,v_3,v_4)$ 不在。故集合对加法不封闭。
9B.7给出 $\mathbf R^3$ 上一个非零交错 2-线性型 $\alpha$ 和一个线性无关组 $v_1,v_2$,使 $\alpha(v_1,v_2)=0$。(这说明 9.39 去掉「$n=\dim V$」就不成立。)
提示用一个只「看」前两个坐标的有向面积。
参考解答令 $\alpha(x,y)=x_1y_2-x_2y_1$。它是双线性的,且 $\alpha(x,x)=0$,所以是交错 2-线性型;$\alpha(e_1,e_2)=1\neq0$,故非零。取 $v_1=e_1=(1,0,0)$、$v_2=e_3=(0,0,1)$,线性无关,但 $\alpha(e_1,e_3)=1\cdot0-0\cdot0=0$。几何上,$\alpha$ 量的是「投影到 $x_1x_2$ 平面后的有向面积」,而 $e_1,e_3$ 张成的平行四边形投影后退化成线段。
9C.1证明或举反例:$S,T\in\mathcal L(V)\ \Rightarrow\ \det(S+T)=\det S+\det T$。
提示试试 $S=T=I$,并回忆 $\det(\lambda I)=\lambda^n$。
参考解答一般不成立。取 $\dim V=2$,$S=T=I$:$\det(S+T)=\det(2I)=2^2=4$,而 $\det S+\det T=1+1=2$。(唯一的例外是 $\dim V=1$:此时每个算子就是乘以一个数 $t$,$\det T=t$,等式成立。)行列式是乘性的(9.49),不是加性的。
9C.3设 $T\in\mathcal L(V)$ 是幂零算子。证明 $\det(I+T)=1$。
提示第 8 章:幂零算子在某组基下的矩阵是严格上三角的(8.18(c))。
参考解答由 8.18(c),存在 $V$ 的基,使 $T$ 的矩阵是对角线及其下方全为 0 的上三角矩阵。于是 $I+T$ 在这组基下的矩阵是对角元全为 1 的上三角矩阵。由 9.53 与 9.48,$\det(I+T)=1\cdot1\cdots1=1$。(在 $\mathbf F=\mathbf C$ 时也可以这样看:$T$ 的特征值只有 0,所以 $I+T$ 的特征值只有 1,由 9.55 得行列式为 1。)
9C.8设 $T\in\mathcal L(V)$ 没有特征值(这意味着 $\mathbf F=\mathbf R$)。证明 $\det T\gt0$。
提示看特征多项式 $p(z)=\det(zI-T)$:它没有实根。它的次数是奇数还是偶数?$p(0)$ 等于什么?
参考解答设 $n=\dim V$,$p(z)=\det(zI-T)$ 是实系数、次数为 $n$ 的首一多项式(9.63),它的实根恰是 $T$ 的特征值(9.51),所以 $p$ 没有实根。奇数次实多项式必有实根,故 $n$ 为偶数。$p$ 连续且无实根,由介值定理它在 $\mathbf R$ 上不变号;又首一、偶数次,$z\to+\infty$ 时 $p(z)\to+\infty$,所以 $p(z)\gt0$ 对所有实数 $z$ 成立。最后 $p(0)=\det(-T)=(-1)^n\det T=\det T$(9.42 第三条,$n$ 为偶数),因此 $\det T=p(0)\gt0$。(可在特征多项式演示里点「旋转 90°」看到二维情形。)
9C.16设 $T\in\mathcal L(V)$,定义 $g:\mathbf F\to\mathbf F$ 为 $g(x)=\det(I+xT)$。证明 $g'(0)=\operatorname{tr}T$。(原书提示:找一个干净的解法,不要用行列式的显式公式。)
提示把 $I+xT$ 写成 $(-x)\big((-\tfrac1x)I-T\big)$,再用特征多项式的系数 9.65。
参考解答设 $n=\dim V$,$p(z)=\det(zI-T)=z^n-(\operatorname{tr}T)z^{n-1}+c_{n-2}z^{n-2}+\cdots+c_0$(9.65)。对 $x\neq0$,$I+xT=(-x)\big((-\tfrac1x)I-T\big)$,由 9.42 第三条, $g(x)=(-x)^n\,p(-\tfrac1x)=(-x)^n\Big[(-\tfrac1x)^n-(\operatorname{tr}T)(-\tfrac1x)^{n-1}+c_{n-2}(-\tfrac1x)^{n-2}+\cdots\Big]=1+(\operatorname{tr}T)\,x+c_{n-2}x^2+\cdots$。 两边都是 $x$ 的多项式(左边由 9.46),且对所有 $x\neq0$ 相等,故恒等。于是 $g'(0)$ 就是 $x$ 的系数 $\operatorname{tr}T$。(直观:$\det(I+xT)\approx1+x\operatorname{tr}T$,行列式在单位算子附近的「一阶变化率」就是迹。)
9C.17设 $a,b,c$ 为正数。找一个体积已知的集合 $\Omega\subseteq\mathbf R^3$ 和一个算子 $T$,使 $T(\Omega)$ 等于椭球 $\{(x,y,z):\frac{x^2}{a^2}+\frac{y^2}{b^2}+\frac{z^2}{c^2}\lt1\}$,从而求出椭球的体积。
提示单位球 + 沿三个坐标轴分别拉伸。
参考解答取 $\Omega$ 为单位开球 $\{x^2+y^2+z^2\lt1\}$,体积 $\frac43\pi$;取 $T(x,y,z)=(ax,by,cz)$。点 $(X,Y,Z)=T(x,y,z)$ 满足 $\frac{X^2}{a^2}+\frac{Y^2}{b^2}+\frac{Z^2}{c^2}=x^2+y^2+z^2$,所以 $T(\Omega)$ 恰好是该椭球。$T$ 的矩阵是 $\operatorname{diag}(a,b,c)$,$\det T=abc$(9.44)。由 9.61,椭球体积 $=|\det T|\cdot\frac43\pi=\frac43\pi abc$。
9D.1设 $v\in V$,$w\in W$。证明 $v\otimes w=0$ 当且仅当 $v=0$ 或 $w=0$。
提示「⇐」用双线性;「⇒」直接用定义 9.71:找一对泛函使 $(v\otimes w)(\varphi,\tau)\neq0$。
参考解答⇐:若 $v=0$,则 $0\otimes w=(0\cdot0)\otimes w=0\cdot(0\otimes w)=0$(9.73);$w=0$ 同理。⇒:用逆否。设 $v\neq0$、$w\neq0$。把 $v$ 扩充为 $V$ 的基并取对偶基的第一个元素 $\varphi$,则 $\varphi(v)=1$;同理有 $\tau\in W'$ 使 $\tau(w)=1$。于是 $(v\otimes w)(\varphi,\tau)=\varphi(v)\tau(w)=1\neq0$,所以 $v\otimes w\neq0$。
9D.4设 $\dim V\gt1$,$\dim W\gt1$。证明 $\{v\otimes w:(v,w)\in V\times W\}$ 不是 $V\otimes W$ 的子空间。
提示证明 $e_1\otimes f_1+e_2\otimes f_2$ 不是单个 $v\otimes w$:用 9.74(b) 比较系数。
参考解答取 $V$ 中线性无关的 $e_1,e_2$,$W$ 中线性无关的 $f_1,f_2$,分别扩充为基 $e_1,\dots,e_m$ 与 $f_1,\dots,f_n$。$e_1\otimes f_1$ 与 $e_2\otimes f_2$ 都在集合中。若其和等于某个 $v\otimes w$,写 $v=\sum_ja_je_j$、$w=\sum_kb_kf_k$,由双线性 $v\otimes w=\sum_{j,k}a_jb_k\,e_j\otimes f_k$。由于 $\{e_j\otimes f_k\}$ 是基(9.74(b)),比较系数得 $a_1b_1=1$、$a_2b_2=1$、$a_1b_2=0$。前两式推出 $a_1\neq0$、$b_2\neq0$,与第三式矛盾。所以集合对加法不封闭,不是子空间。(在矩阵图像里:左上角的 $2\times2$ 单位矩阵秩为 2,而 $v\otimes w$ 的秩不超过 1。)
9D.5按例 9.76 把 $v\otimes w$($v\in\mathbf F^m$,$w\in\mathbf F^n$)等同于 $m\times n$ 矩阵。证明 $\{v\otimes w:v\in\mathbf F^m,\ w\in\mathbf F^n\}$ 恰是全体秩至多为 1 的 $m\times n$ 矩阵。
提示$vw^{\mathrm t}$ 的第 $k$ 列是什么?反过来,秩 $\le1$ 的矩阵的所有列都是哪个向量的倍数?
参考解答$v\otimes w$ 对应 $vw^{\mathrm t}$,其第 $k$ 列是 $w_kv$,都在 $\operatorname{span}(v)$ 中,所以列秩 $\le1$。反之设 $A$ 的秩 $\le1$。若 $A=0$,则 $A$ 对应 $0\otimes0$。否则 $A$ 的列空间是一维的,由某个非零 $v\in\mathbf F^m$ 张成,于是第 $k$ 列为 $c_kv$;令 $c=(c_1,\dots,c_n)$,则 $A=vc^{\mathrm t}$,即 $A$ 对应 $v\otimes c$。
附录

中英术语表

汇总各章术语卡片(共 192 条),方便对照英文原书。输入中文或英文即可筛选;点击章号跳到对应小节。

中文English释义章
复数complex number有序实数对 $(a,b)$,写作 $a+bi$;乘法满足 $i^2=-1$,几何上是「长度相乘、角度相加」。1
标量scalar𝐅(ℝ 或 ℂ)中的元素,即「数」;用来强调它不是向量。1
组 / n 元组list / n-tuple有限长度的有序序列 $(x_1,\dots,x_n)$:顺序有关、重复有意义。1
坐标coordinate$(x_1,\dots,x_n)\in\mathbf{F}^n$ 中的第 $k$ 个分量 $x_k$。1
加法逆元additive inverse满足 $x+(-x)=0$ 的 $-x$;在 ℝ² 中是等长反向的箭头。1
数乘scalar multiplication数 × 向量 = 向量:$\lambda(x_1,\dots,x_n)=(\lambda x_1,\dots,\lambda x_n)$,几何上是伸缩(λ < 0 时反向)。1
域field含 0 ≠ 1、能做加减乘除(除数非零)并满足 1.3 全部性质的集合,如 ℚ、ℝ、ℂ。1
代数闭域algebraically closed field每个非常数多项式都有零点的域;ℂ 是,ℝ 不是。1
向量空间vector space集合 $V$ + 加法 + 数乘,满足交换律、结合律、加法单位元、加法逆元、$1v=v$、分配律。1
加法单位元(零向量additive identity满足 $v+0=v$(对所有 $v$)的元素 $0$;它是唯一的(1.26)。1
实 / 复向量空间real / complex vector space标量取自 ℝ / ℂ 的向量空间;说「𝐅 上的向量空间」以明确标量范围。1
数列空间 𝐅∞F^∞𝐅 中元素的全体数列 $(x_1,x_2,\dots)$,按对应项相加、数乘。1
函数空间 𝐅SF^S从集合 $S$ 到 𝐅 的全体函数,逐点相加、数乘;零向量是零函数。1
向量 / 点vector / point向量空间的元素;可以是箭头、数组、数列、函数……1
子空间subspace在相同运算下自身也是向量空间的子集;等价于:含 0、对加法和数乘封闭(1.34)。1
对加法封闭closed under addition$u,w\in U\Rightarrow u+w\in U$:集合里的元素相加跑不出这个集合。1
子空间的和sum of subspaces$V_1+\dots+V_m=\{v_1+\dots+v_m: v_k\in V_k\}$,是包含各 $V_k$ 的最小子空间。1
直和direct sum每个元素写成 $v_1+\dots+v_m$ 的方式唯一的和,记作 $V_1\oplus\dots\oplus V_m$。1
线性子空间linear subspace「子空间」的另一种说法,意思完全相同。1
偶函数 / 奇函数even / odd function$f(-x)=f(x)$ / $f(-x)=-f(x)$;两类各成子空间,且 $\mathbf{R}^{\mathbf{R}}=V_e\oplus V_o$。1
向量组list of vectors有限长、有顺序、允许重复的一串向量,如 $v_1,\dots,v_m$;书写时通常不加括号。2
线性组合linear combination形如 $a_1v_1+\dots+a_mv_m$ 的向量:沿每个 $v_k$ 走 $a_k$ 倍后到达的位置。2
张成span全部线性组合的集合 $\operatorname{span}(v_1,\dots,v_m)$,是包含这些向量的最小子空间;$\operatorname{span}(\ )=\{0\}$。2
张成 Vspans若 $\operatorname{span}(v_1,\dots,v_m)=V$,就说这个组张成 $V$(它是 $V$ 的张成组)。2
有限维finite-dimensional存在一个(有限长的)组张成整个空间,例如 𝐅ⁿ、$\mathcal{P}_m(\mathbf{F})$。2
无限维infinite-dimensional不是有限维:任何有限个向量都张不满,例如全体多项式 $\mathcal{P}(\mathbf{F})$。2
多项式的次数degree of a polynomial最高非零系数对应的幂次;零多项式的次数规定为 $-\infty$。$\mathcal{P}_m(\mathbf{F})$ 是次数 $\le m$ 的多项式全体。2
线性无关linearly independent只有全零系数能组合出 0 ⟺ 张成中每个向量的写法唯一;空组也算线性无关。2
线性相关linearly dependent存在不全为 0 的系数使 $a_1v_1+\dots+a_mv_m=0$;含零向量或有重复的组一定相关。2
线性相关引理linear dependence lemma相关组中存在 $v_k\in\operatorname{span}(v_1,\dots,v_{k-1})$,删掉它张成不变(2.19)。2
基basis既线性无关又张成 $V$ 的组;等价地,每个 $v\in V$ 都能唯一写成它的线性组合(2.28)。2
标准基standard basis𝐅ⁿ 中的 $(1,0,\dots,0),\dots,(0,\dots,0,1)$;$\mathcal{P}_m(\mathbf{F})$ 中的 $1,z,\dots,z^m$。2
基的判定准则criterion for basis$v_1,\dots,v_n$ 是基 ⟺ 每个向量都能唯一地写成 $a_1v_1+\dots+a_nv_n$;这组系数就是坐标。2
维数dimension有限维空间任意一组基的长度 $\dim V$(所有基一样长,2.34);$\dim\mathbf{F}^n=n$,$\dim\mathcal{P}_m(\mathbf{F})=m+1$。2
和的维数dimension of a sum$\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$,类似集合的容斥原理(2.43)。2
线性映射linear map满足 $T(u+v)=Tu+Tv$、$T(\lambda v)=\lambda Tv$ 的函数 $T:V\to W$;几何上是原点不动、网格保持平行等距的变形。3
ℒ(V, Wvector space of linear maps从 $V$ 到 $W$ 的全体线性映射;按逐点加法与数乘构成向量空间。$\mathcal{L}(V)=\mathcal{L}(V,V)$。3
线性映射引理linear map lemma基 $v_1,\dots,v_n$ 上可任意指定取值 $w_1,\dots,w_n$,且恰有一个线性映射满足 $Tv_k=w_k$。3
线性映射的积product of linear maps$ST=S\circ T$:先做 $T$ 再做 $S$。满足结合律、分配律,但一般不可交换。3
恒等算子identity operator$I\in\mathcal{L}(V)$,$Iv=v$;是乘法的单位元:$TI=IT=T$。3
零空间null space (kernel$\operatorname{null}T=\{v:Tv=0\}$,定义域的子空间;衡量 $T$「压扁」了多少。3
值域range (image$\operatorname{range}T=\{Tv:v\in V\}$,目标空间的子空间;$T$ 能到达的全部向量。3
单射injective (one-to-one$Tu=Tv\Rightarrow u=v$。对线性映射:单射 ⇔ $\operatorname{null}T=\{0\}$。3
满射surjective (onto$\operatorname{range}T=W$;是否满射取决于把哪个空间当目标空间。3
线性映射基本定理fundamental theorem of linear maps$V$ 有限维时 $\dim V=\dim\operatorname{null}T+\dim\operatorname{range}T$:被压扁的维数 + 保留的维数 = 原维数。3
齐次方程组homogeneous system常数项全为 0 的方程组 $Tx=0$;未知数多于方程时必有非零解(3.26)。3
线性映射的矩阵matrix of a linear map$\mathcal{M}(T)$ 的第 $k$ 列 = $Tv_k$ 在 $w_1,\dots,w_m$ 下的坐标;依赖于两组基的选择。3
矩阵乘法matrix multiplication$(AB)_{j,k}=\sum_rA_{j,r}B_{r,k}$;为使 $\mathcal{M}(ST)=\mathcal{M}(S)\mathcal{M}(T)$ 而定义,一般不可交换。3
列秩 / 行秩column rank / row rank各列(各行)张成的空间的维数;两者总相等(3.57)。3
转置transpose$(A^{\mathrm t})_{k,j}=A_{j,k}$:行列互换;$(AC)^{\mathrm t}=C^{\mathrm t}A^{\mathrm t}$。3
列–行分解column–row factorization$A=CR$:$C$ 是 $A$ 的一组「基列」,$R$ 记录每列的组合系数;$C$ 的列数 = 秩。3
秩rank矩阵的列秩(= 行秩);对线性映射,$\mathcal{M}(T)$ 的秩 = $\dim\operatorname{range}T$(3.78)。3
可逆invertible存在 $S$ 使 $ST=I$、$TS=I$;⇔ 单射且满射(3.63)。逆记作 $T^{-1}$,自动线性。3
同构isomorphism, isomorphic可逆线性映射;有限维空间同构 ⇔ 维数相同(3.70)。可理解为「给向量改名」。3
向量的矩阵matrix of a vector$\mathcal{M}(v)$:$v$ 在给定基下的坐标列;且 $\mathcal{M}(Tv)=\mathcal{M}(T)\mathcal{M}(v)$。3
可逆矩阵invertible (nonsingular) matrix存在 $B$ 使 $AB=BA=I$;$(AC)^{-1}=C^{-1}A^{-1}$。3
基变换公式change-of-basis formula$\mathcal{M}(T,(u))=C^{-1}\mathcal{M}(T,(v))C$,其中 $C=\mathcal{M}(I,(u),(v))$。3
积空间product of vector spaces$V_1\times\dots\times V_m$:逐分量运算的组;维数是各维数之和。3
平移(仿射子集translate (affine subset$v+U=\{v+u:u\in U\}$;子空间的两个平移要么相等要么不交。3
商空间quotient space$V/U=\{v+U:v\in V\}$,元素是 $U$ 的平移;$\dim V/U=\dim V-\dim U$。3
商映射quotient map$\pi(v)=v+U$;线性、满射,$\operatorname{null}\pi=U$。3
诱导映射 T̃induced map T̃$\tilde T(v+\operatorname{null}T)=Tv$;单射,且 $V/(\operatorname{null}T)\cong\operatorname{range}T$。3
线性泛函linear functional$V\to\mathbf{F}$ 的线性映射;在 $\mathbf{R}^2$ 中可画成一族平行等距的等值线。3
对偶空间dual space$V'=\mathcal{L}(V,\mathbf{F})$;有限维时 $\dim V'=\dim V$。3
对偶基dual basis$\varphi_j(v_k)=\delta_{jk}$;$\varphi_j(v)$ 就是 $v$ 的第 $j$ 个坐标。3
对偶映射dual map$T'(\varphi)=\varphi\circ T$,方向相反:$W'\to V'$;$(ST)'=T'S'$。3
零化子annihilator$U^0=\{\varphi\in V':\varphi|_U=0\}$;$\dim U^0=\dim V-\dim U$。3
二重对偶double dual$V''=(V')'$;$(\Lambda v)(\varphi)=\varphi(v)$ 给出不依赖基的同构 $V\cong V''$(有限维,习题 3F.32)。3
实部real part, Re z$z=a+bi$ 中的 $a$;复平面上点 $z$ 的横坐标。4
虚部imaginary part, Im z$z=a+bi$ 中的 $b$(一个实数,不是 $bi$);点 $z$ 的纵坐标。4
复共轭complex conjugate, z̄$\bar z=\operatorname{Re}z-(\operatorname{Im}z)i$:$z$ 关于实轴的镜像;$z\bar z=|z|^2$。4
绝对值(模absolute value, |z|$|z|=\sqrt{(\operatorname{Re}z)^2+(\operatorname{Im}z)^2}$:点 $z$ 到原点的距离;$|wz|=|w||z|$。4
三角不等式triangle inequality$|w+z|\le|w|+|z|$:三角形任一边不超过另两边之和;同向时取等号。4
反向三角不等式reverse triangle inequality$\big||w|-|z|\big|\le|w-z|$:两点间距离不小于它们到原点距离之差。4
零点 / 根zero / root使 $p(\lambda)=0$ 的数 $\lambda$;它对应一个一次因式:$p(z)=(z-\lambda)q(z)$(4.6)。4
次数degree, deg p最高次非零系数的次数;由 4.8 知它唯一确定。约定 $\deg 0=-\infty$。4
多项式空间𝒫(𝐅), 𝒫ₘ(𝐅全体多项式 / 次数 ≤ $m$ 的多项式;$\mathcal{P}_m(\mathbf{F})$ 是 $m+1$ 维的,基为 $1,z,\dots,z^m$。4
带余除法division algorithm for polynomials$s\ne0$ 时存在唯一的 $q,r$ 使 $p=sq+r$ 且 $\deg r\lt\deg s$(4.9)。4
商与余式quotient, remainder$p=sq+r$ 中的 $q$ 与 $r$;$p/s=q+r/s$,远处 $p/s\approx q$。4
代数基本定理fundamental theorem of algebra非常数复系数多项式必有复零点(4.12);于是 $p=c(z-\lambda_1)\cdots(z-\lambda_m)$,分解唯一(4.13)。4
棣莫弗定理De Moivre's theorem$(\cos\theta+i\sin\theta)^k=\cos k\theta+i\sin k\theta$;由此每个复数都有 $k$ 次方根。4
绕数winding number闭曲线绕原点转的圈数。$|z|=R$ 的像的绕数 = 圆内零点个数(补充视角,非原书内容)。4
非实零点成对出现nonreal zeros in pairs实系数多项式若以 $\lambda$ 为零点,则 $\bar\lambda$ 也是零点(4.14);零点关于实轴对称。4
配方completing the square$x^2+bx+c=(x+\frac b2)^2+(c-\frac{b^2}{4})$;有实分解 ⟺ $b^2\ge4c$(4.15)。4
实二次因式quadratic factor with b² < 4c$(x-\lambda)(x-\bar\lambda)=x^2-2(\operatorname{Re}\lambda)x+|\lambda|^2$,在 ℝ 上恒正、不能再分解(常称「不可约二次因式」irreducible quadratic)。4
ℝ 上的因式分解factorization of a polynomial over R$p=c\prod(x-\lambda_j)\prod(x^2+b_kx+c_k)$,$b_k^2\lt4c_k$,唯一(4.16)。4
算子operator从向量空间到它自身的线性映射;$\mathcal{L}(V)=\mathcal{L}(V,V)$。5
不变子空间invariant subspace子空间 $U$ 满足:$u\in U\Rightarrow Tu\in U$。5
限制算子restriction operator$U$ 不变时,$T|_U$ 是把 $T$ 只作用在 $U$ 上得到的 $U$ 上的算子。5
特征值eigenvalue数 $\lambda$,使存在 $v\ne 0$ 满足 $Tv=\lambda v$;等价于 $T-\lambda I$ 不可逆(有限维)。5
特征向量eigenvector非零向量 $v$ 满足 $Tv=\lambda v$:被 $T$ 只伸缩、不转向。5
多项式作用于算子p(T), polynomial applied to an operator$p(z)=\sum a_kz^k$ 时 $p(T)=\sum a_kT^k$,常数项变成 $a_0I$。5
首一多项式monic polynomial最高次项系数为 1 的多项式,如 $2+9z^2+z^7$。5
极小多项式minimal polynomial使 $p(T)=0$ 的次数最低的首一多项式;唯一,$\deg p\le\dim V$,零点恰为特征值。5
友矩阵companion matrix次对角线全为 1、最后一列为 $-a_0,\dots,-a_{n-1}$ 的矩阵;它的极小多项式恰为 $a_0+a_1z+\cdots+z^n$(习题 5B.16)。5
算子的矩阵matrix of an operator, ℳ(T关于一组基 $v_1,\dots,v_n$:第 $k$ 列是 $Tv_k$ 的坐标。5
矩阵的对角线diagonal of a matrix方阵从左上角到右下角的那些元素 $A_{1,1},\dots,A_{n,n}$。5
上三角矩阵upper-triangular matrix对角线以下全为 0 的方阵;作为算子的矩阵时,对角元恰为全部特征值。5
对角矩阵diagonal matrix除对角线外全为 0 的方阵。5
可对角化diagonalizable关于某组基有对角矩阵 ⇔ 有由特征向量组成的基 ⇔ 极小多项式是互异一次因式之积。5
特征空间eigenspace, E(λ, T$E(\lambda,T)=\operatorname{null}(T-\lambda I)$:全部对应于 $\lambda$ 的特征向量再加上 0。5
Gershgorin 圆盘Gershgorin disk以 $A_{j,j}$ 为圆心、$\sum_{k\ne j}|A_{j,k}|$ 为半径的闭圆盘;每个特征值都落在某一个里。5
可交换commute$ST=TS$。算子可交换 ⇔ 它们关于同一组基的矩阵可交换(5.74)。5
同时对角化simultaneous diagonalization存在一组基使两个算子的矩阵都是对角的;对可对角化算子,这等价于可交换(5.76)。5
偏导数算子partial differentiation operator$D_w p=\partial p/\partial w$:对一个变量求导,把其他变量当常数;$D_wD_z=D_zD_w$。5
点积dot product$x\cdot y=x_1y_1+\cdots+x_ny_n$;几何上等于 $\|x\|\,\|y\|\cos\theta$。6
内积inner product满足正性、定性、第一位线性、共轭对称的函数 $(u,v)\mapsto\langle u,v\rangle\in\mathbf{F}$。6
内积空间inner product space向量空间连同它上面的一个内积;$\mathbf{F}^n$ 默认配欧氏内积。6
共轭对称conjugate symmetry$\langle u,v\rangle=\overline{\langle v,u\rangle}$;因此第二个位置是共轭线性的:$\langle u,\lambda v\rangle=\overline{\lambda}\langle u,v\rangle$。6
范数norm$\|v\|=\sqrt{\langle v,v\rangle}$,由内积诱导的「长度」。6
正交orthogonal$\langle u,v\rangle=0$;在 $\mathbf{R}^2$、$\mathbf{R}^3$ 中就是垂直。6
正交分解orthogonal decomposition$u=cv+w$,$c=\langle u,v\rangle/\|v\|^2$,$w\perp v$:影子加垂线。6
Cauchy–Schwarz 不等式Cauchy–Schwarz inequality$|\langle u,v\rangle|\le\|u\|\,\|v\|$,共线时取等号。6
三角不等式triangle inequality$\|u+v\|\le\|u\|+\|v\|$,同向(非负实数倍)时取等号。6
平行四边形恒等式parallelogram equality$\|u+v\|^2+\|u-v\|^2=2(\|u\|^2+\|v\|^2)$:对角线平方和 = 四边平方和。6
规范正交组orthonormal list每个向量长度为 1、两两正交:$\langle e_j,e_k\rangle$ 当 $j=k$ 时为 1,否则为 0。6
规范正交基orthonormal basis同时是基的规范正交组;在它下面坐标 $=\langle v,e_k\rangle$。6
Bessel 不等式Bessel’s inequality$\sum_k|\langle v,e_k\rangle|^2\le\|v\|^2$:互相垂直方向上的影子平方和不超过本体长度平方。6
Parseval 恒等式Parseval’s identity对规范正交基:$\|v\|^2=\sum_k|\langle v,e_k\rangle|^2$。6
Gram–Schmidt 过程Gram–Schmidt procedure逐个减去在已有方向上的影子再单位化,把线性无关组变成规范正交组,张成空间逐级不变。6
Schur 定理Schur’s theorem有限维复内积空间上的算子关于某组规范正交基有上三角矩阵。6
线性泛函linear functional从 $V$ 到 $\mathbf{F}$ 的线性映射;全体构成对偶空间 $V'=\mathcal{L}(V,\mathbf{F})$。6
Riesz 表示定理Riesz representation theorem有限维时,每个线性泛函 $\varphi$ 都唯一地写成 $\varphi(u)=\langle u,v\rangle$。6
正交补orthogonal complement$U^\perp=\{v:\langle u,v\rangle=0\ \forall u\in U\}$;有限维 $U$ 满足 $V=U\oplus U^\perp$。6
正交投影orthogonal projection$P_Uv$ = $v$ 在 $U\oplus U^\perp$ 分解中的 $U$ 部分;$P_Uv=\sum\langle v,e_k\rangle e_k$。6
最近点定理minimizing distance to a subspace$\|v-P_Uv\|\le\|v-u\|$ 对所有 $u\in U$ 成立,只在 $u=P_Uv$ 时取等号。6
伪逆pseudoinverse$T^\dagger w=(T|_{(\operatorname{null}T)^\perp})^{-1}P_{\operatorname{range}T}w$:最佳近似解中范数最小的一个。6
最小二乘least squares使残差平方和 $\|y-\hat y\|^2$ 最小:$\hat y$ 是 $y$ 在设计矩阵列空间上的正交投影。6
伴随adjoint, T*满足 $\langle Tv,w\rangle=\langle v,T^*w\rangle$ 的唯一线性映射 $T^*:W\to V$;在规范正交基下矩阵是共轭转置。7
共轭转置conjugate transpose交换行列并逐项取共轭:$(A^*)_{j,k}=\overline{A_{k,j}}$;实矩阵就是转置。7
自伴算子self-adjoint operator$T=T^*$,即 $\langle Tv,w\rangle=\langle v,Tw\rangle$;特征值全是实数,类比实数。7
正规算子normal operator$TT^*=T^*T$;等价于 $\|Tv\|=\|T^*v\|$ 对所有 $v$ 成立。7
斜算子skew operator满足 $B^*=-B$ 的算子(习题 7A.12);正规时特征值都是纯虚数,类比纯虚数。7
实谱定理real spectral theorem$\mathbf F=\mathbf R$:$T$ 自伴 ⟺ $V$ 有由 $T$ 的特征向量构成的规范正交基。7
复谱定理complex spectral theorem$\mathbf F=\mathbf C$:$T$ 正规 ⟺ $V$ 有由 $T$ 的特征向量构成的规范正交基。7
正算子positive operator自伴且 $\langle Tv,v\rangle\ge0$;⟺ 特征值全 ≥ 0 ⟺ $T=R^*R$。类比非负数。7
平方根square root满足 $R^2=T$ 的算子 $R$;一般不唯一($I$ 有无穷多个)。7
正平方根positive square root, √T正算子 $T$ 唯一的正平方根:特征向量不变,特征值开方。7
等距映射isometry保长度的线性映射:$\|Sv\|=\|v\|$;⟺ $S^*S=I$ ⟺ 保内积 ⟺ 矩阵各列规范正交。7
酉算子unitary operator可逆的等距算子:$S^*S=SS^*=I$,$S^{-1}=S^*$;特征值都在单位圆上。7
酉矩阵unitary matrix各列(等价地,各行)规范正交的方阵;实的酉矩阵即正交矩阵。7
QR 分解QR factorization列线性无关的方阵 $A=QR$:$Q$ 酉,$R$ 上三角且对角元为正;就是对列做 Gram–Schmidt。7
正定矩阵positive definite matrix$B^*=B$ 且对所有非零 $x$ 有 $\langle Bx,x\rangle\gt0$;即可逆正算子的矩阵。7
Cholesky 分解Cholesky factorization正定矩阵 $B=R^*R$,$R$ 上三角、对角元为正且唯一;由 $B=A^*A$ 与 $A=QR$ 得到。7
奇异值singular values$T^*T$ 的特征值的非负平方根,降序排列、按特征空间维数重复;共 $\dim V$ 个。7
奇异值分解singular value decomposition (SVD$Tv=\sum_k s_k\langle v,e_k\rangle f_k$,$e_k$、$f_k$ 分别是 $V$、$W$ 中的规范正交组;矩阵形式 $A=BDC^*$。7
对角矩阵(非方阵diagonal matrix (7.74除 $A_{k,k}$($k\le\min\{M,N\}$)外全为 0 的 $M\times N$ 矩阵;每个线性映射在适当的两组规范正交基下都是对角的。7
Schmidt 对Schmidt pair非零向量 $v,w$ 满足 $Tv=sw$ 且 $T^*w=sv$($s\gt0$);$s$ 是奇异值 ⟺ 存在这样一对(习题 7E.2)。7
线性映射的范数norm of a linear map$\|T\|=\max\{\|Tv\|:\|v\|\le1\}$ = 最大奇异值 $s_1$;$\|Tv\|\le\|T\|\,\|v\|$。7
最佳低秩逼近best approximation (rank ≤ k截断 SVD $T_k=\sum_{j\le k}s_j\langle\cdot,e_j\rangle f_j$ 使 $\|T-S\|$ 最小,最小值为 $s_{k+1}$(7.92)。7
极分解polar decomposition$T=S\sqrt{T^*T}$,$S$ 酉、$\sqrt{T^*T}$ 正;类比 $z=\frac{z}{|z|}\cdot|z|$。7
椭球ellipsoid$E(s_1f_1,\dots,s_nf_n)$:把单位球沿规范正交方向 $f_k$ 拉伸 $s_k$ 倍;可逆 $T$ 把球映成主轴为 $s_kf_k$ 的椭球。7
平行多面体parallelepiped$u+P(v_1,\dots,v_n)$,$P=\{\sum a_kv_k:a_k\in(0,1)\}$;可逆算子把平行多面体映成平行多面体。7
盒子box棱互相垂直的平行多面体 $u+P(r_1e_1,\dots,r_ne_n)$;体积 $r_1\cdots r_n$。7
体积volume用互不相交的盒子逼近并求和;可逆 $T$ 使体积乘以 $s_1\cdots s_n$($=|\det T|$)。7
广义特征向量generalized eigenvector非零向量 $v$,满足 $(T-\lambda I)^k v=0$ 对某个正整数 $k$ 成立(等价地 $k=\dim V$)。特征向量是 $k=1$ 的特例。8
幂零算子nilpotent operator某个幂等于 0 的算子;必有 $T^{\dim V}=0$,唯一的特征值是 0。8
特征空间分解eigenspace decomposition$V=E(\lambda_1,T)\oplus\cdots\oplus E(\lambda_m,T)$;成立 ⇔ $T$ 可对角化(5.55)。8
广义特征空间generalized eigenspace$G(\lambda,T)=\{v:(T-\lambda I)^k v=0\ \text{对某个}\ k\}=\operatorname{null}(T-\lambda I)^{\dim V}$。8
重数multiplicity特征值 $\lambda$ 的重数 $=\dim G(\lambda,T)$;在 ℂ 上所有重数之和为 $\dim V$。8
代数重数algebraic multiplicity即本书的「重数」$\dim G(\lambda,T)$;等于 $\lambda$ 在上三角矩阵对角线上出现的次数。8
几何重数geometric multiplicity$\dim E(\lambda,T)=\dim\operatorname{null}(T-\lambda I)$,不超过代数重数。8
特征多项式characteristic polynomial$\mathbf{F}=\mathbf{C}$ 时 $(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}$,$d_k$ 为重数;次数 $=\dim V$。8
Cayley–Hamilton 定理Cayley–Hamilton theorem设 $q$ 是 $T$ 的特征多项式,则 $q(T)=0$(ℂ 上,8.29)。8
分块对角矩阵block diagonal matrix沿对角线排着若干方阵 $A_1,\dots,A_m$、其余元素全为 0 的方阵。8
平方根square root满足 $R^2=T$ 的算子 $R$;ℂ 上可逆算子一定有平方根(8.41)。8
Jordan 基Jordan basis使 $T$ 的矩阵成为由 Jordan 块组成的分块对角矩阵的基;ℂ 上总存在(8.46)。8
Jordan 块Jordan block对角线全为 $\lambda$、紧挨对角线上方全为 1、其余为 0 的方阵;对应一条链。8
Jordan 标准形Jordan form$T$ 在 Jordan 基下的矩阵:除对角线与其上方一条线外全是 0。8
矩阵的迹trace of a matrix方阵对角元之和 $\operatorname{tr}A$;满足 $\operatorname{tr}(AB)=\operatorname{tr}(BA)$。8
算子的迹trace of an operator$\operatorname{tr}T=\operatorname{tr}\mathcal{M}(T)$,与基无关;ℂ 上等于特征值按重数之和。8
双线性型bilinear form$\beta:V\times V\to\mathbf F$,固定任一个槽,另一个槽都是线性泛函。坐标下 $\beta(x,y)=x^{\mathrm t}Ay$。9
双线性型的矩阵matrix of a bilinear form$\mathcal M(\beta)_{j,k}=\beta(e_j,e_k)$;换基公式 $A=C^{\mathrm t}BC$(9.7)。9
对称双线性型symmetric bilinear form$\rho(u,w)=\rho(w,u)$;矩阵在每组基下都对称,且总有一组基使之对角(9.12)。9
交错双线性型alternating bilinear form$\alpha(v,v)=0$ 对一切 $v$ 成立,等价于 $\alpha(u,w)=-\alpha(w,u)$(9.16)。9
二次型quadratic form$q(v)=\beta(v,v)$;由唯一的对称双线性型决定(9.21),可化为 $\lambda_1x_1^2+\cdots+\lambda_nx_n^2$(9.23)。9
对称矩阵symmetric matrix满足 $A=A^{\mathrm t}$ 的方阵;对称双线性型的矩阵。9
m-线性型m-linear form$\beta:V^m\to\mathbf F$,其余槽固定时对每个槽都线性;全体记作 $V^{(m)}$。9
多重线性型multilinear form对某个正整数 $m$ 是 $m$-线性型的函数。9
交错多重线性型alternating multilinear form有两个输入相同就输出 0;等价地,交换两个输入就变号;输入线性相关就输出 0。9
置换permutation$1,\dots,m$ 的一个重新排列 $(j_1,\dots,j_m)$;全体记作 $\operatorname{perm}m$,共 $m!$ 个。9
置换的符号sign of a permutation$(-1)^N$,$N$ 为逆序对个数;交换任意两个元素必使符号翻转(9.34)。9
行列式determinant满足 $\alpha_T=(\det T)\alpha$(对所有交错 $n$-型 $\alpha$)的唯一数:带符号的体积缩放倍数。9
特征多项式characteristic polynomial$z\mapsto\det(zI-T)$:首一、次数 $\dim V$,零点是特征值,$=z^n-(\operatorname{tr}T)z^{n-1}+\cdots+(-1)^n\det T$。9
Hadamard 不等式Hadamard’s inequality$|\det A|\le\prod_k\|v_k\|$($v_k$ 为列):边长给定时,正交的平行六面体体积最大。9
Vandermonde 矩阵Vandermonde matrix第 $j$ 行为 $1,\beta_j,\dots,\beta_j^{n-1}$ 的矩阵,行列式 $\prod_{j\lt k}(\beta_k-\beta_j)$。9
Cayley–Hamilton 定理Cayley–Hamilton theorem特征多项式 $q$ 满足 $q(T)=0$,实、复向量空间都成立(9.64)。9
双线性泛函bilinear functional$\beta:V\times W\to\mathbf F$,对两个槽分别线性;全体记作 $\mathcal B(V,W)$,维数 $(\dim V)(\dim W)$。9
张量积tensor product$V\otimes W=\mathcal B(V',W')$;$(v\otimes w)(\varphi,\tau)=\varphi(v)\tau(w)$。在 $\mathbf F^m\otimes\mathbf F^n$ 中 $v\otimes w\leftrightarrow vw^{\mathrm t}$。9
双线性映射bilinear map$\Gamma:V\times W\to U$,对每个槽都是线性映射(目标可以是任意向量空间)。9
泛性质universal property每个双线性映射 $\Gamma$ 唯一对应一个线性映射 $\hat\Gamma:V\otimes W\to U$,$\hat\Gamma(v\otimes w)=\Gamma(v,w)$(9.79)。9
m-线性泛函m-linear functional$V_1\times\cdots\times V_m\to\mathbf F$,每个槽都线性;全体 $\mathcal B(V_1,\dots,V_m)$ 的维数是各维数之积。9