第 1 章 数学基础:先学会“用数学描述不确定”
1.1 为什么要先学数学
通信中的“信息”不是“文字有多少”,而是“接收方有多不确定”。数学上,我们用概率描述不确定性,用集合和函数描述“可能发生的事件”和“事件之间的关系”。
这一章只讲后面真正会用到的部分。
1.2 集合、事件与随机变量
样本空间记为 $\Omega$,表示所有可能结果的集合。事件是 $\Omega$ 的子集。例如掷一颗骰子:
$$ \Omega=\{1,2,3,4,5,6\} $$“掷出偶数”是事件:
$$ A=\{2,4,6\} $$随机变量是从样本空间到实数(或集合)的映射。它把“不知道会得到哪个结果”这件事,变成一个我们可以计算的数值。
- 离散随机变量:取有限或可数多个值,如“抛硬币结果 $X\in\{0,1\}$”。
- 连续随机变量:取一段连续区间,如接收信号噪声 $N$。
- 概率质量函数:$p_X(x)=P(X=x)$,用于离散随机变量。
- 概率密度函数:$f_X(x)$,用于连续随机变量,满足 $\int_{-\infty}^{\infty} f_X(x)\,dx=1$。
- 累积分布函数:$F_X(x)=P(X\le x)$。
判断题:概率是“长期试验中的频率”,不是“某个事件的绝对真理”。这句话在通信中很重要,因为信道噪声是随机过程,我们只能描述它的统计规律。
1.3 期望、方差与协方差
对于离散随机变量 $X$,期望为:
$$ \mathbb{E}[X]=\sum_x x\,p_X(x) $$对于连续随机变量,期望为:
$$ \mathbb{E}[X]=\int_{-\infty}^{\infty} x\,f_X(x)\,dx $$期望可以理解为“平均结果”。方差描述“离平均值的平均偏差平方”:
$$ \operatorname{Var}(X)=\mathbb{E}\left[(X-\mathbb{E}[X])^2\right]=\mathbb{E}[X^2]-(\mathbb{E}[X])^2 $$标准差是方差的平方根。噪声越强,方差越大,接收信号越容易被扰动。
两个随机变量的协方差描述“它们是否一起变化”:
$$ \operatorname{Cov}(X,Y)=\mathbb{E}[(X-\mathbb{E}[X])(Y-\mathbb{E}[Y])] $$如果 $X$ 和 $Y$ 独立,那么协方差为 0;但协方差为 0 不一定意味着独立。
为什么通信要用这些:信道模型 $Y=X+N$ 中,$N$ 往往是均值为 0、方差为 $\sigma^2$ 的高斯噪声。噪声的方差决定了信道有多“脏”。
1.4 条件概率、贝叶斯公式
条件概率表示“已知某些信息后,重新评估不确定性”:
$$ P(A\mid B)=\frac{P(A\cap B)}{P(B)} $$如果 $A$ 和 $B$ 独立,则:
$$ P(A\cap B)=P(A)P(B) $$由此得到贝叶斯公式:
$$ P(A\mid B)=\frac{P(B\mid A)P(A)}{P(B)} $$它最常用的理解是:
后验 = 似然 × 先验 / 归一化。
在通信接收端,我们收到信号 $y$ 后,需要判断发送的符号 $x$ 是什么。这正是“在观测下进行推断”的过程。
1.5 高斯分布
高斯分布(正态分布)是最重要的连续分布之一:
$$ f_N(n)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(n-\mu)^2}{2\sigma^2}\right) $$常记为:
$$ N\sim \mathcal{N}(\mu,\sigma^2) $$在通信中,最常见的是加性高斯白噪声(AWGN,Additive White Gaussian Noise)。它满足:
$$ Y=X+N,\qquad N\sim \mathcal{N}(0,\sigma^2) $$“白”意味着不同时间点上的噪声互不相关,功率在整个频带上近似均匀地分布。“高斯”意味着幅度分布服从高斯分布。
一个直观例子:如果你发送的是 $+1$ 或 $-1$,接收端收到的值会被噪声扰动。如果噪声足够小,你可以通过信号的正负判断发送的是哪个符号;如果噪声很大,判断就可能出错。
1.6 大数定律与中心极限定理
大数定律告诉我们:当试验次数很多时,样本平均值会接近理论期望。
中心极限定理告诉我们:许多独立随机变量的和,即使每个变量本身不是高斯分布,在数量足够大时,其归一化和也近似服从高斯分布。
$$ \frac{\sum_{i=1}^n X_i-n\mu}{\sqrt{n}\sigma}\xrightarrow{d}\mathcal{N}(0,1) $$这两个定理解释了两件事:
- 为什么我们可以用大量实验来估计概率。
- 为什么高斯噪声和许多“随机叠加”的现象在工程中普遍出现。
1.7 向量、范数与点积
通信和深度学习中,一个对象经常被表示为一个向量,例如:
$$ \mathbf{x}=(x_1,x_2,\dots,x_d)^\top \in \mathbb{R}^d $$内积(点积)为:
$$ \langle \mathbf{u},\mathbf{v}\rangle=\mathbf{u}^\top\mathbf{v}=\sum_{i=1}^d u_i v_i $$欧几里得范数为:
$$ \|\mathbf{u}\|_2=\sqrt{\langle \mathbf{u},\mathbf{u}\rangle}=\sqrt{\sum_{i=1}^d u_i^2} $$两个向量之间的夹角为:
$$ \cos\theta=\frac{\langle \mathbf{u},\mathbf{v}\rangle}{\|\mathbf{u}\|_2\|\mathbf{v}\|_2} $$为什么语义通信常用到它:如果把一句话翻译成一个向量,那么“意义相近”的两个句子往往具有更接近的向量方向。这样,语义相似度常被近似为余弦相似度。
1.8 正交、基与线性变换
如果两个向量内积为 0,则称它们正交:
$$ \langle \mathbf{u},\mathbf{v}\rangle=0 $$例如,$\mathbf{e}_1=(1,0)$ 和 $\mathbf{e}_2=(0,1)$ 是二维空间的一组正交基。
在通信中,正交性的用处很大:不同的信号如果不互相重叠,就可以同时发送而不互相干扰。
一个线性变换可以写成矩阵乘法:
$$ \mathbf{y}=\mathbf{A}\mathbf{x} $$其中 $\mathbf{A}\in\mathbb{R}^{m\times n}$,$\mathbf{x}\in\mathbb{R}^n$,$\mathbf{y}\in\mathbb{R}^m$。
为什么矩阵在通信中重要:
- 多个收发天线构成 MIMO 系统时,信道是矩阵。
- 多用户之间、多载波之间的干扰也是矩阵形式。
- 神经网络中的每一层也可以看作一个可学习的线性变换。
1.9 特征值分解与奇异值分解
对于方阵 $\mathbf{A}$,如果存在非零向量 $\mathbf{v}$ 和标量 $\lambda$ 满足:
$$ \mathbf{A}\mathbf{v}=\lambda\mathbf{v} $$则 $\lambda$ 是特征值,$\mathbf{v}$ 是对应特征向量。
奇异值分解(SVD)适用于任意矩阵:
$$ \mathbf{A}=\mathbf{U}\mathbf{\Sigma}\mathbf{V}^\top $$其中 $\mathbf{U},\mathbf{V}$ 是正交阵,$\mathbf{\Sigma}$ 是对角阵,对角线元素为奇异值。
直观理解:SVD 告诉我们,一个线性变换可以分解成“旋转—拉伸—旋转”三步。奇异值越大,代表矩阵在这个方向上的“放大”作用越强,因此也越重要。
在通信中,SVD 常用于 MIMO 信道分解,把复杂的多天线信道拆成多个并行的简单信道。在深度学习中的主成分分析(PCA)、低秩近似、模型压缩中也很常见。
1.10 最大似然与最大后验
假设观测是 $y$,模型参数是 $\theta$,似然函数为:
$$ L(\theta)=p(y\mid \theta) $$最大似然估计(MLE)选择使似然最大的参数:
$$ \hat{\theta}_{\text{MLE}}=\arg\max_{\theta} p(y\mid \theta) $$如果引入先验 $p(\theta)$,则有最大后验估计:
$$ \hat{\theta}_{\text{MAP}}=\arg\max_{\theta} p(\theta\mid y) =\arg\max_{\theta} p(y\mid\theta)p(\theta) $$在通信中,接收端判断发送符号时经常用最大似然准则:
$$ \hat{x}_{\text{ML}}=\arg\max_{x} p(y\mid x) $$一句话总结:概率和优化是通信信息论的“语言”,神经网络则是“可学习的函数”。