S
语义通信入门
Semantic Communication
📘 入门教材

第 1 章 数学基础:先学会“用数学描述不确定”

1.1 为什么要先学数学

通信中的“信息”不是“文字有多少”,而是“接收方有多不确定”。数学上,我们用概率描述不确定性,用集合和函数描述“可能发生的事件”和“事件之间的关系”。

这一章只讲后面真正会用到的部分。

1.2 集合、事件与随机变量

样本空间记为 $\Omega$,表示所有可能结果的集合。事件是 $\Omega$ 的子集。例如掷一颗骰子:

$$ \Omega=\{1,2,3,4,5,6\} $$

“掷出偶数”是事件:

$$ A=\{2,4,6\} $$

随机变量是从样本空间到实数(或集合)的映射。它把“不知道会得到哪个结果”这件事,变成一个我们可以计算的数值。

  • 离散随机变量:取有限或可数多个值,如“抛硬币结果 $X\in\{0,1\}$”。
  • 连续随机变量:取一段连续区间,如接收信号噪声 $N$。
  • 概率质量函数:$p_X(x)=P(X=x)$,用于离散随机变量。
  • 概率密度函数:$f_X(x)$,用于连续随机变量,满足 $\int_{-\infty}^{\infty} f_X(x)\,dx=1$。
  • 累积分布函数:$F_X(x)=P(X\le x)$。

判断题:概率是“长期试验中的频率”,不是“某个事件的绝对真理”。这句话在通信中很重要,因为信道噪声是随机过程,我们只能描述它的统计规律。

1.3 期望、方差与协方差

对于离散随机变量 $X$,期望为:

$$ \mathbb{E}[X]=\sum_x x\,p_X(x) $$

对于连续随机变量,期望为:

$$ \mathbb{E}[X]=\int_{-\infty}^{\infty} x\,f_X(x)\,dx $$

期望可以理解为“平均结果”。方差描述“离平均值的平均偏差平方”:

$$ \operatorname{Var}(X)=\mathbb{E}\left[(X-\mathbb{E}[X])^2\right]=\mathbb{E}[X^2]-(\mathbb{E}[X])^2 $$

标准差是方差的平方根。噪声越强,方差越大,接收信号越容易被扰动。

两个随机变量的协方差描述“它们是否一起变化”:

$$ \operatorname{Cov}(X,Y)=\mathbb{E}[(X-\mathbb{E}[X])(Y-\mathbb{E}[Y])] $$

如果 $X$ 和 $Y$ 独立,那么协方差为 0;但协方差为 0 不一定意味着独立。

为什么通信要用这些:信道模型 $Y=X+N$ 中,$N$ 往往是均值为 0、方差为 $\sigma^2$ 的高斯噪声。噪声的方差决定了信道有多“脏”。

1.4 条件概率、贝叶斯公式

条件概率表示“已知某些信息后,重新评估不确定性”:

$$ P(A\mid B)=\frac{P(A\cap B)}{P(B)} $$

如果 $A$ 和 $B$ 独立,则:

$$ P(A\cap B)=P(A)P(B) $$

由此得到贝叶斯公式:

$$ P(A\mid B)=\frac{P(B\mid A)P(A)}{P(B)} $$

它最常用的理解是:

后验 = 似然 × 先验 / 归一化。

在通信接收端,我们收到信号 $y$ 后,需要判断发送的符号 $x$ 是什么。这正是“在观测下进行推断”的过程。

1.5 高斯分布

高斯分布(正态分布)是最重要的连续分布之一:

$$ f_N(n)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(n-\mu)^2}{2\sigma^2}\right) $$

常记为:

$$ N\sim \mathcal{N}(\mu,\sigma^2) $$

在通信中,最常见的是加性高斯白噪声(AWGN,Additive White Gaussian Noise)。它满足:

$$ Y=X+N,\qquad N\sim \mathcal{N}(0,\sigma^2) $$

“白”意味着不同时间点上的噪声互不相关,功率在整个频带上近似均匀地分布。“高斯”意味着幅度分布服从高斯分布。

一个直观例子:如果你发送的是 $+1$ 或 $-1$,接收端收到的值会被噪声扰动。如果噪声足够小,你可以通过信号的正负判断发送的是哪个符号;如果噪声很大,判断就可能出错。

1.6 大数定律与中心极限定理

大数定律告诉我们:当试验次数很多时,样本平均值会接近理论期望。

中心极限定理告诉我们:许多独立随机变量的和,即使每个变量本身不是高斯分布,在数量足够大时,其归一化和也近似服从高斯分布。

$$ \frac{\sum_{i=1}^n X_i-n\mu}{\sqrt{n}\sigma}\xrightarrow{d}\mathcal{N}(0,1) $$

这两个定理解释了两件事:

  1. 为什么我们可以用大量实验来估计概率。
  2. 为什么高斯噪声和许多“随机叠加”的现象在工程中普遍出现。

1.7 向量、范数与点积

通信和深度学习中,一个对象经常被表示为一个向量,例如:

$$ \mathbf{x}=(x_1,x_2,\dots,x_d)^\top \in \mathbb{R}^d $$

内积(点积)为:

$$ \langle \mathbf{u},\mathbf{v}\rangle=\mathbf{u}^\top\mathbf{v}=\sum_{i=1}^d u_i v_i $$

欧几里得范数为:

$$ \|\mathbf{u}\|_2=\sqrt{\langle \mathbf{u},\mathbf{u}\rangle}=\sqrt{\sum_{i=1}^d u_i^2} $$

两个向量之间的夹角为:

$$ \cos\theta=\frac{\langle \mathbf{u},\mathbf{v}\rangle}{\|\mathbf{u}\|_2\|\mathbf{v}\|_2} $$

为什么语义通信常用到它:如果把一句话翻译成一个向量,那么“意义相近”的两个句子往往具有更接近的向量方向。这样,语义相似度常被近似为余弦相似度。

1.8 正交、基与线性变换

如果两个向量内积为 0,则称它们正交:

$$ \langle \mathbf{u},\mathbf{v}\rangle=0 $$

例如,$\mathbf{e}_1=(1,0)$ 和 $\mathbf{e}_2=(0,1)$ 是二维空间的一组正交基。

在通信中,正交性的用处很大:不同的信号如果不互相重叠,就可以同时发送而不互相干扰。

一个线性变换可以写成矩阵乘法:

$$ \mathbf{y}=\mathbf{A}\mathbf{x} $$

其中 $\mathbf{A}\in\mathbb{R}^{m\times n}$,$\mathbf{x}\in\mathbb{R}^n$,$\mathbf{y}\in\mathbb{R}^m$。

为什么矩阵在通信中重要

  • 多个收发天线构成 MIMO 系统时,信道是矩阵。
  • 多用户之间、多载波之间的干扰也是矩阵形式。
  • 神经网络中的每一层也可以看作一个可学习的线性变换。

1.9 特征值分解与奇异值分解

对于方阵 $\mathbf{A}$,如果存在非零向量 $\mathbf{v}$ 和标量 $\lambda$ 满足:

$$ \mathbf{A}\mathbf{v}=\lambda\mathbf{v} $$

则 $\lambda$ 是特征值,$\mathbf{v}$ 是对应特征向量。

奇异值分解(SVD)适用于任意矩阵:

$$ \mathbf{A}=\mathbf{U}\mathbf{\Sigma}\mathbf{V}^\top $$

其中 $\mathbf{U},\mathbf{V}$ 是正交阵,$\mathbf{\Sigma}$ 是对角阵,对角线元素为奇异值。

直观理解:SVD 告诉我们,一个线性变换可以分解成“旋转—拉伸—旋转”三步。奇异值越大,代表矩阵在这个方向上的“放大”作用越强,因此也越重要。

在通信中,SVD 常用于 MIMO 信道分解,把复杂的多天线信道拆成多个并行的简单信道。在深度学习中的主成分分析(PCA)、低秩近似、模型压缩中也很常见。

1.10 最大似然与最大后验

假设观测是 $y$,模型参数是 $\theta$,似然函数为:

$$ L(\theta)=p(y\mid \theta) $$

最大似然估计(MLE)选择使似然最大的参数:

$$ \hat{\theta}_{\text{MLE}}=\arg\max_{\theta} p(y\mid \theta) $$

如果引入先验 $p(\theta)$,则有最大后验估计:

$$ \hat{\theta}_{\text{MAP}}=\arg\max_{\theta} p(\theta\mid y) =\arg\max_{\theta} p(y\mid\theta)p(\theta) $$

在通信中,接收端判断发送符号时经常用最大似然准则:

$$ \hat{x}_{\text{ML}}=\arg\max_{x} p(y\mid x) $$

一句话总结:概率和优化是通信信息论的“语言”,神经网络则是“可学习的函数”。