S
语义通信入门
Semantic Communication
📘 入门教材

附录 A 公式速查卡

A.1 概率与统计

名称 公式
期望 $\mathbb{E}[X]=\sum_x x p(x)$
方差 $\operatorname{Var}(X)=\mathbb{E}[X^2]-(\mathbb{E}[X])^2$
条件概率 $P(A\mid B)=P(A\cap B)/P(B)$
贝叶斯 $P(A\mid B)=P(B\mid A)P(A)/P(B)$
高斯分布 $f(x)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)$
大数定律 $\bar{X}_n\xrightarrow{p}\mu$
中心极限定理 $(\sum_i X_i-n\mu)/(\sqrt{n}\sigma)\xrightarrow{d}\mathcal{N}(0,1)$

A.2 向量与矩阵

名称 公式
内积 $\langle \mathbf{u},\mathbf{v}\rangle=\sum_i u_i v_i$
2-范数 $|\mathbf{u}|_2=\sqrt{\langle \mathbf{u},\mathbf{u}\rangle}$
余弦相似度 $\cos\theta=\langle \mathbf{u},\mathbf{v}\rangle/(|\mathbf{u}||\mathbf{v}|)$
线性变换 $\mathbf{y}=\mathbf{A}\mathbf{x}$
特征值 $\mathbf{A}\mathbf{v}=\lambda\mathbf{v}$
SVD $\mathbf{A}=\mathbf{U}\mathbf{\Sigma}\mathbf{V}^\top$

A.3 信息论

名称 公式
自信息 $I(x)=-\log p(x)$
$H(X)=-\sum_x p(x)\log p(x)$
联合熵 $H(X,Y)=-\sum_{x,y}p(x,y)\log p(x,y)$
条件熵 $H(Y\mid X)=-\sum_{x,y}p(x,y)\log p(y\mid x)$
链式法则 $H(X,Y)=H(X)+H(Y\mid X)$
互信息 $I(X;Y)=H(X)-H(X\mid Y)$
KL 散度 $D_{\mathrm{KL}}(p\parallel q)=\sum_x p(x)\log\frac{p(x)}{q(x)}$
交叉熵 $H(p,q)=-\sum_x p(x)\log q(x)$
数据不等式 $X\to Y\to Z\Rightarrow I(X;Z)\le I(X;Y)$
信道容量 $C=\max_{p(x)}I(X;Y)$
AWGN 容量 $C=\frac12\log_2(1+P/\sigma^2)$
率失真 $R(D)=\min_{\mathbb{E}[d(X,\hat X)]\le D}I(X;\hat X)$
高斯 RD $R(D)=\frac12\log_2(\sigma^2/D)$

A.4 信号与通信

名称 公式
采样定理 $f_s\ge 2f_{\max}$
傅里叶变换 $S(f)=\int s(t)e^{-j2\pi ft}\,dt$
卷积 $y(t)=(s*h)(t)$
AWGN $Y=X+N,\ N\sim\mathcal{N}(0,\sigma^2)$
信噪比 $\mathrm{SNR}=P_{\text{signal}}/P_{\text{noise}}$
容量(带宽形式) $C=B\log_2(1+\mathrm{SNR})$
误码率 $P_e=Q\left(\sqrt{P/\sigma^2}\right)$(BPSK 示意)
ASK/QAM 简洁模型 $y=hx+n$

A.5 深度学习

名称 公式
神经元 $z=\sigma(\mathbf{w}^\top\mathbf{x}+b)$
多层感知机 $\mathbf{a}^{(l)}=\sigma(\mathbf{W}^{(l)}\mathbf{a}^{(l-1)}+\mathbf{b}^{(l)})$
交叉熵 $\mathcal{L}=-\sum_c y_c\log\hat{y}_c$
MSE $\mathcal{L}=\frac1N\sum_i|f(\mathbf{x}_i)-\hat{x}_i|^2$
梯度下降 $\theta\leftarrow\theta-\eta\nabla_\theta\mathcal{L}$
注意力 $\mathrm{Attn}(Q,K,V)=\mathrm{softmax}(QK^\top/\sqrt{d_k})V$
自编码器 $\hat{\mathbf{x}}=g_\phi(f_\theta(\mathbf{x}))$
VAE ELBO $\mathbb{E}_{q}[\log p(\mathbf{x}\mid \mathbf{z})]-D_{\mathrm{KL}}(q\parallel p(\mathbf{z}))$

A.6 语义通信常用符号

符号 含义
$X$ 原始数据/源
$V$ 任务变量
$S$ 语义命题/语义表示
$\hat S$ 接收端理解的语义
$\mathbf{z}$ 编码器输出特征
$\mathbf{s}$ 信道输入(通常经功率归一化)
$Y,\mathbf{y}$ 信道输出
$K_S,K_R$ 发送端/接收端知识
$f_\theta,g_\phi,T_\psi$ 编码器、解码器、任务模型
$R_s(D_s)$ 语义率失真(研究框架)
$I_s(S;\hat S)$ 语义互信息(研究框架)
$d_s(s,\hat s)$ 语义失真

附录 B 重要术语中英对照

中文 English 一句话解释
通信 Communication 传递信息
信号 Signal 携带信息的物理量
信道 Channel 传播信号的媒介及其数学模型
信噪比 SNR 有用信号功率与噪声功率之比
带宽 Bandwidth 可用频率范围
调制 Modulation 把符号/比特映射为信号
解调 Demodulation 从信号中恢复符号/比特
源编码 Source Coding 压缩数据
信道编码 Channel Coding 加冗余抗噪声
联合信源信道编码 JSCC 联合压缩/抗噪设计
信息论 Information Theory 研究信息度量与极限
Entropy 平均不确定性
互信息 Mutual Information 一个变量对另一个变量的信息贡献
信道容量 Channel Capacity 可靠传输的速率上限
率失真 Rate-Distortion 给定失真下的最小速率
深度学习 Deep Learning 用多层神经网络学习映射
表示学习 Representation Learning 学习把对象变成向量/特征
语义 Semantics 数据/符号所表达的意义
语义信息 Semantic Information 与意义有关的信息
语义熵 Semantic Entropy 衡量语义不确定性的研究概念
语义编码 Semantic Coding 提取/压缩语义
语义解码 Semantic Decoding 从接收信号恢复语义/任务
语义噪声 Semantic Noise 理解差异或语义混淆
语义对齐 Semantic Alignment 让双方对语义解释一致
任务导向通信 Goal/Task-Oriented Communication 优化下游任务
知识图谱 Knowledge Graph 用实体和关系表示知识
生成模型 Generative Model 从噪声/条件生成数据
预训练模型 Pretrained Model 先在大数据上学习,再微调
语义率失真 Semantic Rate-Distortion 语义度量下的压缩极限(研究框架)
数字孪生 Digital Twin 物理系统的虚拟副本
元宇宙 Metaverse 虚拟/增强世界
语义缓存 Semantic Caching 缓存语义而非原始数据

附录 C 练习题(含思路提示)

C.1 概念题

  1. 为什么香农说“语义与工程问题无关”?现在为什么又要重新讨论语义?
  2. 传统通信的“成功”和语义通信的“成功”分别是什么?
  3. 为什么语义通信不能违反香农容量?
  4. “传得比特少”是否等于“语义压缩”?为什么?
  5. 为什么接收方知识会影响需要传输的信息量?
  6. MAC 层和物理层之间,语义通信通常做了哪些跨层设计?

C.2 推导题

  1. 证明二元熵 $h_2(p)$ 在 $p=1/2$ 时最大。
  2. 证明 $I(X;Y)=D_{\mathrm{KL}}(p(x,y)\parallel p(x)p(y))$。
  3. 由互信息定义,证明 $I(X;Y)=H(X)+H(Y)-H(X,Y)$。
  4. 根据信源熵的定义,解释为什么 $R\ge H(X)$ 是平均码长的下界。
  5. 写出一维高斯信源的率失真函数 $R(D)$,并解释 $D\to 0$ 和 $D\to \sigma^2$ 的极限。
  6. 说明数据不等式为什么限制“后处理”带来的信息增益。

C.3 设计题

  1. 设计一个“只传图片类别”的语义通信系统,写出系统框图和至少三个评价指标。
  2. 设计一个实验,比较“JPEG+LDPC+QPSK”和“Deep JSCC”在低 SNR 下的图像分类性能,指出哪些公平条件必须统一。
  3. 如果接收端有一个预训练 CLIP 模型,发送端应如何利用它来减少传输量?请给出至少两种方法及其风险。
  4. 一个系统需要同时支持“图像重建”和“目标检测”,如何设计损失函数和调度策略?
  5. 如何防止语义特征泄露用户隐私?写出至少三个方案,并评价代价。

C.4 代码练习思路

  1. 用 PyTorch 写一个简单自编码器,在 CIFAR-10 上训练。
  2. 给编码器输出加功率归一化,再加高斯噪声,计算 PSNR。
  3. 把 MSE 损失改成分类交叉熵,比较“重建性能”和“分类性能”。
  4. 分别训练固定 SNR 和多个 SNR,观察模型对信道变化的鲁棒性。
  5. 比较连续传输和量化传输,画出不同压缩率下的性能曲线。
  6. 加入一个任务解码器,用“任务准确率”作为主要指标,重新训练。

附录 D 学习资料与选择建议

D.1 数学与信号

  • 线性代数、概率论、高等数学:基础中的基础。
  • 《概率论与数理统计》任意一本经典教材。
  • 《信号与系统》《数字信号处理》任意一本入门教材。

D.2 信息论

  • Cover & Thomas, Elements of Information Theory:概念最系统。
  • 香农 1948 原始论文:建议看前几章,理解问题起源。
  • 各种中文信息论/通信原理教材。

D.3 通信原理

  • 《通信原理》中的基本调制、信道编码、频谱、误码分析。
  • 无线通信中的 AWGN、衰落、MIMO、OFDM。

D.4 深度学习与语义

  • 《深度学习》原书或吴恩达/李沐等课程。
  • Transformer、Attention、VAE、CLIP、扩散模型。
  • 语义通信综述:搜索 “semantic communication survey”“task-oriented communication”“deep JSCC”。

D.5 开始写代码的建议

  1. 用 CPU 也可以先跑小数据集。
  2. 先把“无信道”自编码器跑通,再加噪声。
  3. 再实现传统“JPEG+QPSK+LDPC”基线。
  4. 最后做语义/任务导向的系统。
  5. 记录所有实验设置,便于复现和写论文。


附录 E 关键定理的证明脉络

E.1 KL 散度为什么一定非负

由 Jensen 不等式出发:

$$ \mathbb{E}[-\log Q]\ge -\log\mathbb{E}[Q] $$

更具体地,对凸函数 $-\log(\cdot)$:

$$ D_{\mathrm{KL}}(p\parallel q) =\mathbb{E}_p\left[-\log\frac{q(X)}{p(X)}\right] \ge -\log\mathbb{E}_p\left[\frac{q(X)}{p(X)}\right] =-\log 1=0 $$

所以 KL 散度非负,当且仅当 $p=q$ 时等于 0。

这为什么重要:它是互信息非负、交叉熵不小于熵等很多结论的基础。

E.2 二元熵最大值的证明思路

令:

$$ f(p)=h_2(p)=-p\log p-(1-p)\log(1-p) $$

求导:

$$ f'(p)=\log\frac{1-p}{p} $$

令 $f'(p)=0$,得到 $p=1/2$。二阶导数小于 0,因此 $f(p)$ 在 $p=1/2$ 处取得最大值:

$$ h_2(1/2)=1 $$

直觉:最不确定时,抛硬币无法预测,因此“信息量”最大;如果结果几乎确定,信息量接近 0。

E.3 数据不等式为什么成立

设 $X\to Y\to Z$,即给定 $Y$ 后 $X$ 与 $Z$ 条件独立。于是:

$$ I(X;Z\mid Y)=0 $$

由互信息链式法则:

$$ I(X;Y,Z)=I(X;Y)+I(X;Z\mid Y) $$$$ I(X;Y,Z)=I(X;Z)+I(X;Y\mid Z) $$

因为互信息非负,所以:

$$ I(X;Z)\le I(X;Y,Z) $$

而右边又可以化成 $I(X;Y)$。因此:

$$ I(X;Z)\le I(X;Y) $$

它告诉我们什么:接收端对接收信号的任何处理,不会凭空增加关于源的信息。

E.4 AEP 的证明直觉

设独立同分布序列 $X_1,\dots,X_n$。大数定律作用于:

$$ -\frac1n\log p(X_1,\dots,X_n) =-\frac1n\sum_{i=1}^n\log p(X_i) $$

因为每个 $-\log p(X_i)$ 的期望是 $H(X)$,所以该平均值依概率收敛到 $H(X)$。

于是:

$$ p(X_1,\dots,X_n)\approx 2^{-nH(X)} $$

几乎所有典型序列近似等概率,典型序列个数约为:

$$ |\mathcal{A}_\epsilon^{(n)}|\approx 2^{nH(X)} $$

这就是“熵决定压缩极限”的微观解释。

E.5 无损信源编码定理的证明直觉

对长度为 $n$ 的典型序列,我们只需要为约 $2^{nH(X)}$ 个典型序列设计码字。每个码字平均长度为:

$$ R_n\approx H(X) $$

把非典型序列也编码进去,并在码长足够长时让它们的概率趋于 0,就得到:

$$ R\ge H(X) $$

反过来构造一种“典型序列编码”,可以证明 $R$ 可以任意接近 $H(X)$。

E.6 信道编码定理的证明直觉

香农证明的大致思路是随机编码

  1. 随机生成 $2^{nR}$ 个长度为 $n$ 的码字。
  2. 接收端收到 $y^n$ 后,寻找与 $y^n$ 联合典型的码字。
  3. 如果发送码字与其他码字发生碰撞,就发生错误。
  4. 用联合典型性和大数定律,可以证明当 $n$ 足够大且 $R

所以,容量:

$$ C=\max_{p(x)}I(X;Y) $$

是“可靠通信的渐近临界值”,而不是简单的一条工程经验。

E.7 率失真定理的证明直觉

率失真证明类似:

  1. 从满足期望失真不超过 $D$ 的条件分布 $p(\hat x\mid x)$ 出发。
  2. 随机生成一组“重建码本”。
  3. 对每个源序列,选择与它联合典型且失真足够小的重建码本。
  4. 若 $R>I(X;\hat X)$,则存在平均失真不超过 $D$ 的压缩方案;若 $R

因此:

$$ R(D)=\min_{\mathbb{E}[d(X,\hat X)]\le D}I(X;\hat X) $$

E.8 AWGN 容量的关键一步

对:

$$ Y=X+N,\quad N\sim\mathcal{N}(0,\sigma^2) $$

输入功率约束为 $P$。互信息为:

$$ I(X;Y)=h(Y)-h(Y\mid X)=h(Y)-h(N) $$

给定方差约束时,高斯分布熵最大:

$$ h(Y)\le \frac12\log_2\left(2\pi e(P+\sigma^2)\right) $$

同时:

$$ h(N)=\frac12\log_2(2\pi e\sigma^2) $$

于是:

$$ I(X;Y)\le \frac12\log_2\left(1+\frac{P}{\sigma^2}\right) $$

取输入 $X\sim\mathcal{N}(0,P)$,上式等号成立。这就是 AWGN 容量公式的来源。

E.9 信源信道分离定理为什么成立

若信源熵率为 $H(X)\le C$:

  1. 用无损信源编码把 $n$ 个符号压缩成约 $nH(X)$ 比特。
  2. 再用信道编码以速率 $R_c
  3. 由于 $H(X)\le C$,可以让信道译码错误概率任意小。
  4. 合并两步,源信息仍然能恢复。

反过来,如果 $H(X)>C$,由数据不等式、法诺不等式等信息论结果,可以证明接收端恢复原始源时必然存在正错误概率。

再次提醒:这个定理给出的是“渐近意义下的最优性”,不代表“分开设计在有限码长和具体任务下总是最优”。


结语

语义通信不是一个“只要背公式就能学会”的课,而是一个通信、信息论、人工智能、系统设计、安全和应用交叉起来的新问题。

对于你这样一个计算机专业、零通信基础的学生来说,最好的策略是:

  1. 把香农信息论当作地基:先理解熵、互信息、容量和率失真;
  2. 把深度学习当作工具:理解编码、表示、任务、损失和信道;
  3. 把语义当作研究对象:不要着急给“语义”下唯一定义,而是先问“在什么任务、什么知识、什么评价下讨论语义”;
  4. 把实验当作验证:用一两个小项目跑通闭环,再投入论文研究。

当你能够清楚地说明:

我的系统在“什么源、什么信道、什么任务、什么评价指标”下,比“什么基线”好在哪、代价是什么、为什么。

你就已经从零基础,真正进入了语义通信研究的大门。


本教材为入门学习材料。语义通信目前仍处于快速发展和定义不断演化的阶段,具体研究方向请以最新文献、标准化组织和导师指导为准。