第 5 章 神经网络:语义通信的“引擎”
5.1 深度学习解决了什么问题
传统通信把“压缩”“纠错”“调制”当作手工设计的模块。深度学习提供一个自动学习映射的方式:
$$ \mathbf{z}=f_\theta(\mathbf{x}) $$其中 $\mathbf{x}$ 是输入数据,$\mathbf{z}$ 是输出特征或预测,$\theta$ 是网络参数。
如果给神经网络一个目标函数,它就可以自动学习“怎样的特征对任务有用”。这正是语义通信最需要的能力:自动提取“语义”,而不是人工定义“语义”的编码表。
5.2 一个最简单的神经网络
人工神经元可以写成:
$$ z=\sigma\left(\sum_{i=1}^{n}w_i x_i+b\right) $$写成向量形式:
$$ z=\sigma(\mathbf{w}^\top\mathbf{x}+b) $$其中:
- $\mathbf{x}$ 是输入;
- $\mathbf{w}$ 是权重;
- $b$ 是偏置;
- $\sigma$ 是激活函数。
常用的激活函数:
- ReLU:$\sigma(x)=\max(0,x)$
- Sigmoid:$\sigma(x)=1/(1+e^{-x})$
- Tanh:$\sigma(x)=\tanh(x)$
- Softmax:将向量变成概率分布
多层感知机(MLP)就是多个神经元连成网络。第 $l$ 层可以记为:
$$ \mathbf{a}^{(l)}=\sigma\left(\mathbf{W}^{(l)}\mathbf{a}^{(l-1)}+\mathbf{b}^{(l)}\right) $$5.3 为什么神经网络能学习:梯度与反向传播
训练目标是极小化损失:
$$ \mathcal{L}(\theta)=\frac{1}{N}\sum_{i=1}^{N}\ell(f_\theta(\mathbf{x}_i),y_i) $$梯度下降更新:
$$ \theta\leftarrow \theta-\eta\nabla_\theta\mathcal{L}(\theta) $$其中 $\eta$ 是学习率。
反向传播本质上是链式法则在计算图上的高效实现。如果损失是:
$$ \mathcal{L}=\ell(a_3),\quad a_3=h(a_2),\quad a_2=g(a_1),\quad a_1=f(\mathbf{x}) $$则:
$$ \frac{\partial \mathcal{L}}{\partial \theta}=\frac{\partial \mathcal{L}}{\partial a_3}\frac{\partial a_3}{\partial a_2}\frac{\partial a_2}{\partial a_1}\frac{\partial a_1}{\partial \theta} $$实际网络更深,但思路一样:从输出往输入反向求导。
5.4 损失函数:告诉网络“什么是好”
在分类任务中常用交叉熵:
$$ \mathcal{L}_{\mathrm{CE}}=-\sum_{c=1}^{C}y_c\log \hat{y}_c $$其中 $\hat{y}_c$ 是模型预测类别 $c$ 的概率,$y_c$ 是真实标签的 one-hot 表示。
在回归或重建任务中常用均方误差:
$$ \mathcal{L}_{\mathrm{MSE}}=\frac{1}{N}\sum_{i=1}^{N}\|f_\theta(\mathbf{x}_i)-\hat{\mathbf{x}}_i\|^2 $$对语义通信来说,损失函数可以不只是“重建得像不像”,还可以包含:
- 分类/检测/翻译是否正确;
- 语义向量是否相近;
- 传输速率是否足够低;
- 是否符合物理信道约束。
5.5 训练中的关键概念
- 训练集、验证集、测试集:先训练,再调参,最后只测一次,避免“把测试集也学进去”。
- 过拟合与欠拟合:过拟合是记住了训练数据,泛化差;欠拟合是模型太弱,训练误差也高。
- 正则化:L2 正则化 $\lambda\|\theta\|^2$、dropout、早停、数据增强等,都是为了让模型更稳。
- 学习率:太小收敛慢,太大可能发散。
- 批量大小:影响梯度估计的方差和训练速度。
- Adam:一种自适应学习率优化器,实践中广泛使用。
对语义通信的重要意义:训练数据分布、信道分布、任务分布都可能变化。一个只在特定信噪比下训练的语义编码器,可能在另一个信噪比下严重退化。这叫做“信道失配”或“分布漂移”。
5.6 卷积网络:处理图像和空间数据
卷积层对局部窗口做加权求和:
$$ Z_{i,j,k}=\sum_{c}\sum_{u}\sum_{v}W_{u,v,c,k}X_{i+u,j+v,c}+b_k $$它在图像中体现“局部相关性”:相邻像素往往相关,卷积核可以学习边缘、纹理、形状等特征。
在卷积网络后,通常接池化层,例如最大池化:
$$ Y_{i,j}=\max_{u,v}X_{2i+u,2j+v} $$池化降低分辨率、扩大感受野、减少计算量。
语义通信中的用途:图像语义编码常用卷积神经网络提取空间特征,再由解码器重建图像或直接输出任务结果。
5.7 循环网络与序列建模
循环神经网络(RNN)在每个时刻维护一个隐含状态:
$$ \mathbf{h}_t=f(\mathbf{W}_x\mathbf{x}_t+\mathbf{W}_h\mathbf{h}_{t-1}+\mathbf{b}) $$它可以处理文本、语音、时间序列,但长距离依赖较弱。LSTM 和 GRU 通过门控机制缓解这个问题。
5.8 注意力机制与 Transformer
注意力机制的核心是:根据查询 Query 和键 Key 的相似度,对不同 Value 分配权重。
$$ \text{Attention}(Q,K,V)=\text{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right)V $$其中:
- $Q$:查询向量;
- $K$:键向量;
- $V$:值向量;
- $d_k$:键向量的维度;
- $\sqrt{d_k}$:缩放因子,防止点积过大导致梯度问题。
对语义通信的意义:Transformer 可以建模长文本、图像块、多模态之间的依赖。今天许多语义通信系统用预训练语言模型或视觉模型提取语义特征,再用轻量信道编码器传输。
5.9 自编码器:压缩的本质
自编码器由编码器和解码器组成:
$$ \mathbf{z}=f_\theta(\mathbf{x}),\qquad \hat{\mathbf{x}}=g_\phi(\mathbf{z}) $$训练目标通常是:
$$ \mathcal{L}=\mathbb{E}[d(\mathbf{x},\hat{\mathbf{x}})] $$如果 $\mathbf{z}$ 的维度远小于 $\mathbf{x}$,模型必须学会“保留最重要的信息”。这就是学习式压缩。
**变分自编码器(VAE)**引入一个潜在变量分布:
$$ q_\phi(\mathbf{z}\mid \mathbf{x}) $$并通过最大化证据下界(ELBO)训练:
$$ \mathcal{L}_{\mathrm{VAE}}= \mathbb{E}_{q_\phi(\mathbf{z}\mid \mathbf{x})}[\log p_\theta(\mathbf{x}\mid\mathbf{z})] -D_{\mathrm{KL}}\bigl(q_\phi(\mathbf{z}\mid\mathbf{x})\,\|\,p(\mathbf{z})\bigr) $$VAE 让潜在空间更光滑、可采样,因此常用于生成模型和语义压缩研究。
5.10 生成模型与预训练大模型
- GAN:一个生成器试图骗过判别器,判别器试图区分真假。常用于图像生成、图像修复。
- 扩散模型:从纯噪声逐步去噪得到数据。近年来在图像、视频生成中非常成功。
- 自监督预训练:不依赖人工标签,而是通过预测掩码词、对比样本等任务学习表示。
- 大语言模型(LLM):在海量文本上预训练,可以理解句子、生成回答、进行推理。
对语义通信的启发:
- 大模型可以充当“共享知识”,发送方和接收方都可以利用它补齐缺失细节。
- 大模型可以生成新的内容,因此“语义传输”不必逐像素恢复,而可以是“传关键语义,接收方用先验生成”。
- 但也带来隐患:生成模型可能“补得太多”,生成出与事实不一致的内容,造成“语义幻觉”。
5.11 表示学习:把“意义”变成向量
表示学习的核心思想是:用一个高维向量表示一个对象,使相似对象在向量空间中靠近。
$$ \mathbf{v}(\text{“猫”})\approx \mathbf{v}(\text{“小猫”}),\qquad \mathbf{v}(\text{“猫”})\not\approx \mathbf{v}(\text{“狗”}) $$常用的语义相似度是余弦相似度:
$$ \mathrm{sim}(\mathbf{u},\mathbf{v}) =\frac{\langle \mathbf{u},\mathbf{v}\rangle}{\|\mathbf{u}\|\|\mathbf{v}\|} $$请区分两个词:
- 表示:某个对象的向量或特征(Representation)。
- 语义:向量所代表的“意思”,它依赖于任务、上下文和接收方先验,不完全等于向量本身。
所以严格说,我们不是“找到唯一正确的语义向量”,而是“训练出一个对当前任务足够有效的表示”。
5.12 多模态表示
多模态表示学习把文本、图像、语音等不同模态映射到同一个语义空间。
例如 CLIP 学习图像和文本的联合表示:
$$ \mathrm{sim}(\mathbf{v}_{\text{image}},\mathbf{v}_{\text{text}}) $$如果图片里有猫,图片向量与“a cat”文本向量的相似度会高于与“a dog”文本向量的相似度。
这对语义通信非常有用:发送端可以只传一种模态或部分语义,接收端利用另一模态的共享表示理解内容。
5.13 端到端训练与可微信道
传统网络直接可以端到端训练,但无线信道包含随机噪声和离散调制。为了让梯度能够回传,需要让信道“可微”:
- 对加性高斯噪声,直接加噪声就是可微的。
- 对 BPSK/QAM 等离散调制,常使用 Gumbel-Softmax、直通估计、或把符号当作连续值并在训练后量化。
- 对衰落信道,可以采样信道增益并让梯度通过信道模型。
这也解释了一个关键现象:很多深度学习语义通信系统在仿真中使用“可微信道模型”,但实际硬件中信道行为未必和仿真完全一致,所以鲁棒性研究非常重要。
第 5 章小结
- 神经网络是一个可学习的映射,适合学习“什么特征对任务有用”。
- 卷积适合图像,Transformer 适合序列/多模态,自编码器适合学习压缩。
- 交叉熵、MSE、语义损失可以组合成端到端目标。
- 表示学习把语义问题变成向量空间中的相似度问题。
- 语义通信不仅是“用深度学习”,还要处理信道、先验、任务和泛化的关系。