附录 A 公式速查卡
A.1 概率与统计
| 名称 | 公式 |
|---|---|
| 期望 | $\mathbb{E}[X]=\sum_x x p(x)$ |
| 方差 | $\operatorname{Var}(X)=\mathbb{E}[X^2]-(\mathbb{E}[X])^2$ |
| 条件概率 | $P(A\mid B)=P(A\cap B)/P(B)$ |
| 贝叶斯 | $P(A\mid B)=P(B\mid A)P(A)/P(B)$ |
| 高斯分布 | $f(x)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)$ |
| 大数定律 | $\bar{X}_n\xrightarrow{p}\mu$ |
| 中心极限定理 | $(\sum_i X_i-n\mu)/(\sqrt{n}\sigma)\xrightarrow{d}\mathcal{N}(0,1)$ |
A.2 向量与矩阵
| 名称 | 公式 |
|---|---|
| 内积 | $\langle \mathbf{u},\mathbf{v}\rangle=\sum_i u_i v_i$ |
| 2-范数 | $|\mathbf{u}|_2=\sqrt{\langle \mathbf{u},\mathbf{u}\rangle}$ |
| 余弦相似度 | $\cos\theta=\langle \mathbf{u},\mathbf{v}\rangle/(|\mathbf{u}||\mathbf{v}|)$ |
| 线性变换 | $\mathbf{y}=\mathbf{A}\mathbf{x}$ |
| 特征值 | $\mathbf{A}\mathbf{v}=\lambda\mathbf{v}$ |
| SVD | $\mathbf{A}=\mathbf{U}\mathbf{\Sigma}\mathbf{V}^\top$ |
A.3 信息论
| 名称 | 公式 |
|---|---|
| 自信息 | $I(x)=-\log p(x)$ |
| 熵 | $H(X)=-\sum_x p(x)\log p(x)$ |
| 联合熵 | $H(X,Y)=-\sum_{x,y}p(x,y)\log p(x,y)$ |
| 条件熵 | $H(Y\mid X)=-\sum_{x,y}p(x,y)\log p(y\mid x)$ |
| 链式法则 | $H(X,Y)=H(X)+H(Y\mid X)$ |
| 互信息 | $I(X;Y)=H(X)-H(X\mid Y)$ |
| KL 散度 | $D_{\mathrm{KL}}(p\parallel q)=\sum_x p(x)\log\frac{p(x)}{q(x)}$ |
| 交叉熵 | $H(p,q)=-\sum_x p(x)\log q(x)$ |
| 数据不等式 | $X\to Y\to Z\Rightarrow I(X;Z)\le I(X;Y)$ |
| 信道容量 | $C=\max_{p(x)}I(X;Y)$ |
| AWGN 容量 | $C=\frac12\log_2(1+P/\sigma^2)$ |
| 率失真 | $R(D)=\min_{\mathbb{E}[d(X,\hat X)]\le D}I(X;\hat X)$ |
| 高斯 RD | $R(D)=\frac12\log_2(\sigma^2/D)$ |
A.4 信号与通信
| 名称 | 公式 |
|---|---|
| 采样定理 | $f_s\ge 2f_{\max}$ |
| 傅里叶变换 | $S(f)=\int s(t)e^{-j2\pi ft}\,dt$ |
| 卷积 | $y(t)=(s*h)(t)$ |
| AWGN | $Y=X+N,\ N\sim\mathcal{N}(0,\sigma^2)$ |
| 信噪比 | $\mathrm{SNR}=P_{\text{signal}}/P_{\text{noise}}$ |
| 容量(带宽形式) | $C=B\log_2(1+\mathrm{SNR})$ |
| 误码率 | $P_e=Q\left(\sqrt{P/\sigma^2}\right)$(BPSK 示意) |
| ASK/QAM 简洁模型 | $y=hx+n$ |
A.5 深度学习
| 名称 | 公式 |
|---|---|
| 神经元 | $z=\sigma(\mathbf{w}^\top\mathbf{x}+b)$ |
| 多层感知机 | $\mathbf{a}^{(l)}=\sigma(\mathbf{W}^{(l)}\mathbf{a}^{(l-1)}+\mathbf{b}^{(l)})$ |
| 交叉熵 | $\mathcal{L}=-\sum_c y_c\log\hat{y}_c$ |
| MSE | $\mathcal{L}=\frac1N\sum_i|f(\mathbf{x}_i)-\hat{x}_i|^2$ |
| 梯度下降 | $\theta\leftarrow\theta-\eta\nabla_\theta\mathcal{L}$ |
| 注意力 | $\mathrm{Attn}(Q,K,V)=\mathrm{softmax}(QK^\top/\sqrt{d_k})V$ |
| 自编码器 | $\hat{\mathbf{x}}=g_\phi(f_\theta(\mathbf{x}))$ |
| VAE ELBO | $\mathbb{E}_{q}[\log p(\mathbf{x}\mid \mathbf{z})]-D_{\mathrm{KL}}(q\parallel p(\mathbf{z}))$ |
A.6 语义通信常用符号
| 符号 | 含义 |
|---|---|
| $X$ | 原始数据/源 |
| $V$ | 任务变量 |
| $S$ | 语义命题/语义表示 |
| $\hat S$ | 接收端理解的语义 |
| $\mathbf{z}$ | 编码器输出特征 |
| $\mathbf{s}$ | 信道输入(通常经功率归一化) |
| $Y,\mathbf{y}$ | 信道输出 |
| $K_S,K_R$ | 发送端/接收端知识 |
| $f_\theta,g_\phi,T_\psi$ | 编码器、解码器、任务模型 |
| $R_s(D_s)$ | 语义率失真(研究框架) |
| $I_s(S;\hat S)$ | 语义互信息(研究框架) |
| $d_s(s,\hat s)$ | 语义失真 |
附录 B 重要术语中英对照
| 中文 | English | 一句话解释 |
|---|---|---|
| 通信 | Communication | 传递信息 |
| 信号 | Signal | 携带信息的物理量 |
| 信道 | Channel | 传播信号的媒介及其数学模型 |
| 信噪比 | SNR | 有用信号功率与噪声功率之比 |
| 带宽 | Bandwidth | 可用频率范围 |
| 调制 | Modulation | 把符号/比特映射为信号 |
| 解调 | Demodulation | 从信号中恢复符号/比特 |
| 源编码 | Source Coding | 压缩数据 |
| 信道编码 | Channel Coding | 加冗余抗噪声 |
| 联合信源信道编码 | JSCC | 联合压缩/抗噪设计 |
| 信息论 | Information Theory | 研究信息度量与极限 |
| 熵 | Entropy | 平均不确定性 |
| 互信息 | Mutual Information | 一个变量对另一个变量的信息贡献 |
| 信道容量 | Channel Capacity | 可靠传输的速率上限 |
| 率失真 | Rate-Distortion | 给定失真下的最小速率 |
| 深度学习 | Deep Learning | 用多层神经网络学习映射 |
| 表示学习 | Representation Learning | 学习把对象变成向量/特征 |
| 语义 | Semantics | 数据/符号所表达的意义 |
| 语义信息 | Semantic Information | 与意义有关的信息 |
| 语义熵 | Semantic Entropy | 衡量语义不确定性的研究概念 |
| 语义编码 | Semantic Coding | 提取/压缩语义 |
| 语义解码 | Semantic Decoding | 从接收信号恢复语义/任务 |
| 语义噪声 | Semantic Noise | 理解差异或语义混淆 |
| 语义对齐 | Semantic Alignment | 让双方对语义解释一致 |
| 任务导向通信 | Goal/Task-Oriented Communication | 优化下游任务 |
| 知识图谱 | Knowledge Graph | 用实体和关系表示知识 |
| 生成模型 | Generative Model | 从噪声/条件生成数据 |
| 预训练模型 | Pretrained Model | 先在大数据上学习,再微调 |
| 语义率失真 | Semantic Rate-Distortion | 语义度量下的压缩极限(研究框架) |
| 数字孪生 | Digital Twin | 物理系统的虚拟副本 |
| 元宇宙 | Metaverse | 虚拟/增强世界 |
| 语义缓存 | Semantic Caching | 缓存语义而非原始数据 |
附录 C 练习题(含思路提示)
C.1 概念题
- 为什么香农说“语义与工程问题无关”?现在为什么又要重新讨论语义?
- 传统通信的“成功”和语义通信的“成功”分别是什么?
- 为什么语义通信不能违反香农容量?
- “传得比特少”是否等于“语义压缩”?为什么?
- 为什么接收方知识会影响需要传输的信息量?
- MAC 层和物理层之间,语义通信通常做了哪些跨层设计?
C.2 推导题
- 证明二元熵 $h_2(p)$ 在 $p=1/2$ 时最大。
- 证明 $I(X;Y)=D_{\mathrm{KL}}(p(x,y)\parallel p(x)p(y))$。
- 由互信息定义,证明 $I(X;Y)=H(X)+H(Y)-H(X,Y)$。
- 根据信源熵的定义,解释为什么 $R\ge H(X)$ 是平均码长的下界。
- 写出一维高斯信源的率失真函数 $R(D)$,并解释 $D\to 0$ 和 $D\to \sigma^2$ 的极限。
- 说明数据不等式为什么限制“后处理”带来的信息增益。
C.3 设计题
- 设计一个“只传图片类别”的语义通信系统,写出系统框图和至少三个评价指标。
- 设计一个实验,比较“JPEG+LDPC+QPSK”和“Deep JSCC”在低 SNR 下的图像分类性能,指出哪些公平条件必须统一。
- 如果接收端有一个预训练 CLIP 模型,发送端应如何利用它来减少传输量?请给出至少两种方法及其风险。
- 一个系统需要同时支持“图像重建”和“目标检测”,如何设计损失函数和调度策略?
- 如何防止语义特征泄露用户隐私?写出至少三个方案,并评价代价。
C.4 代码练习思路
- 用 PyTorch 写一个简单自编码器,在 CIFAR-10 上训练。
- 给编码器输出加功率归一化,再加高斯噪声,计算 PSNR。
- 把 MSE 损失改成分类交叉熵,比较“重建性能”和“分类性能”。
- 分别训练固定 SNR 和多个 SNR,观察模型对信道变化的鲁棒性。
- 比较连续传输和量化传输,画出不同压缩率下的性能曲线。
- 加入一个任务解码器,用“任务准确率”作为主要指标,重新训练。
附录 D 学习资料与选择建议
D.1 数学与信号
- 线性代数、概率论、高等数学:基础中的基础。
- 《概率论与数理统计》任意一本经典教材。
- 《信号与系统》《数字信号处理》任意一本入门教材。
D.2 信息论
- Cover & Thomas, Elements of Information Theory:概念最系统。
- 香农 1948 原始论文:建议看前几章,理解问题起源。
- 各种中文信息论/通信原理教材。
D.3 通信原理
- 《通信原理》中的基本调制、信道编码、频谱、误码分析。
- 无线通信中的 AWGN、衰落、MIMO、OFDM。
D.4 深度学习与语义
- 《深度学习》原书或吴恩达/李沐等课程。
- Transformer、Attention、VAE、CLIP、扩散模型。
- 语义通信综述:搜索 “semantic communication survey”“task-oriented communication”“deep JSCC”。
D.5 开始写代码的建议
- 用 CPU 也可以先跑小数据集。
- 先把“无信道”自编码器跑通,再加噪声。
- 再实现传统“JPEG+QPSK+LDPC”基线。
- 最后做语义/任务导向的系统。
- 记录所有实验设置,便于复现和写论文。
附录 E 关键定理的证明脉络
E.1 KL 散度为什么一定非负
由 Jensen 不等式出发:
$$ \mathbb{E}[-\log Q]\ge -\log\mathbb{E}[Q] $$更具体地,对凸函数 $-\log(\cdot)$:
$$ D_{\mathrm{KL}}(p\parallel q) =\mathbb{E}_p\left[-\log\frac{q(X)}{p(X)}\right] \ge -\log\mathbb{E}_p\left[\frac{q(X)}{p(X)}\right] =-\log 1=0 $$所以 KL 散度非负,当且仅当 $p=q$ 时等于 0。
这为什么重要:它是互信息非负、交叉熵不小于熵等很多结论的基础。
E.2 二元熵最大值的证明思路
令:
$$ f(p)=h_2(p)=-p\log p-(1-p)\log(1-p) $$求导:
$$ f'(p)=\log\frac{1-p}{p} $$令 $f'(p)=0$,得到 $p=1/2$。二阶导数小于 0,因此 $f(p)$ 在 $p=1/2$ 处取得最大值:
$$ h_2(1/2)=1 $$直觉:最不确定时,抛硬币无法预测,因此“信息量”最大;如果结果几乎确定,信息量接近 0。
E.3 数据不等式为什么成立
设 $X\to Y\to Z$,即给定 $Y$ 后 $X$ 与 $Z$ 条件独立。于是:
$$ I(X;Z\mid Y)=0 $$由互信息链式法则:
$$ I(X;Y,Z)=I(X;Y)+I(X;Z\mid Y) $$$$ I(X;Y,Z)=I(X;Z)+I(X;Y\mid Z) $$因为互信息非负,所以:
$$ I(X;Z)\le I(X;Y,Z) $$而右边又可以化成 $I(X;Y)$。因此:
$$ I(X;Z)\le I(X;Y) $$它告诉我们什么:接收端对接收信号的任何处理,不会凭空增加关于源的信息。
E.4 AEP 的证明直觉
设独立同分布序列 $X_1,\dots,X_n$。大数定律作用于:
$$ -\frac1n\log p(X_1,\dots,X_n) =-\frac1n\sum_{i=1}^n\log p(X_i) $$因为每个 $-\log p(X_i)$ 的期望是 $H(X)$,所以该平均值依概率收敛到 $H(X)$。
于是:
$$ p(X_1,\dots,X_n)\approx 2^{-nH(X)} $$几乎所有典型序列近似等概率,典型序列个数约为:
$$ |\mathcal{A}_\epsilon^{(n)}|\approx 2^{nH(X)} $$这就是“熵决定压缩极限”的微观解释。
E.5 无损信源编码定理的证明直觉
对长度为 $n$ 的典型序列,我们只需要为约 $2^{nH(X)}$ 个典型序列设计码字。每个码字平均长度为:
$$ R_n\approx H(X) $$把非典型序列也编码进去,并在码长足够长时让它们的概率趋于 0,就得到:
$$ R\ge H(X) $$反过来构造一种“典型序列编码”,可以证明 $R$ 可以任意接近 $H(X)$。
E.6 信道编码定理的证明直觉
香农证明的大致思路是随机编码:
- 随机生成 $2^{nR}$ 个长度为 $n$ 的码字。
- 接收端收到 $y^n$ 后,寻找与 $y^n$ 联合典型的码字。
- 如果发送码字与其他码字发生碰撞,就发生错误。
- 用联合典型性和大数定律,可以证明当 $n$ 足够大且 $R
所以,容量:
$$ C=\max_{p(x)}I(X;Y) $$是“可靠通信的渐近临界值”,而不是简单的一条工程经验。
E.7 率失真定理的证明直觉
率失真证明类似:
- 从满足期望失真不超过 $D$ 的条件分布 $p(\hat x\mid x)$ 出发。
- 随机生成一组“重建码本”。
- 对每个源序列,选择与它联合典型且失真足够小的重建码本。
- 若 $R>I(X;\hat X)$,则存在平均失真不超过 $D$ 的压缩方案;若 $R
因此:
$$ R(D)=\min_{\mathbb{E}[d(X,\hat X)]\le D}I(X;\hat X) $$E.8 AWGN 容量的关键一步
对:
$$ Y=X+N,\quad N\sim\mathcal{N}(0,\sigma^2) $$输入功率约束为 $P$。互信息为:
$$ I(X;Y)=h(Y)-h(Y\mid X)=h(Y)-h(N) $$给定方差约束时,高斯分布熵最大:
$$ h(Y)\le \frac12\log_2\left(2\pi e(P+\sigma^2)\right) $$同时:
$$ h(N)=\frac12\log_2(2\pi e\sigma^2) $$于是:
$$ I(X;Y)\le \frac12\log_2\left(1+\frac{P}{\sigma^2}\right) $$取输入 $X\sim\mathcal{N}(0,P)$,上式等号成立。这就是 AWGN 容量公式的来源。
E.9 信源信道分离定理为什么成立
若信源熵率为 $H(X)\le C$:
- 用无损信源编码把 $n$ 个符号压缩成约 $nH(X)$ 比特。
- 再用信道编码以速率 $R_c
- 由于 $H(X)\le C$,可以让信道译码错误概率任意小。
- 合并两步,源信息仍然能恢复。
反过来,如果 $H(X)>C$,由数据不等式、法诺不等式等信息论结果,可以证明接收端恢复原始源时必然存在正错误概率。
再次提醒:这个定理给出的是“渐近意义下的最优性”,不代表“分开设计在有限码长和具体任务下总是最优”。
结语
语义通信不是一个“只要背公式就能学会”的课,而是一个通信、信息论、人工智能、系统设计、安全和应用交叉起来的新问题。
对于你这样一个计算机专业、零通信基础的学生来说,最好的策略是:
- 把香农信息论当作地基:先理解熵、互信息、容量和率失真;
- 把深度学习当作工具:理解编码、表示、任务、损失和信道;
- 把语义当作研究对象:不要着急给“语义”下唯一定义,而是先问“在什么任务、什么知识、什么评价下讨论语义”;
- 把实验当作验证:用一两个小项目跑通闭环,再投入论文研究。
当你能够清楚地说明:
我的系统在“什么源、什么信道、什么任务、什么评价指标”下,比“什么基线”好在哪、代价是什么、为什么。
你就已经从零基础,真正进入了语义通信研究的大门。
本教材为入门学习材料。语义通信目前仍处于快速发展和定义不断演化的阶段,具体研究方向请以最新文献、标准化组织和导师指导为准。