S
语义通信入门
Semantic Communication
📘 入门教材

第 5 章 神经网络:语义通信的“引擎”

5.1 深度学习解决了什么问题

传统通信把“压缩”“纠错”“调制”当作手工设计的模块。深度学习提供一个自动学习映射的方式:

$$ \mathbf{z}=f_\theta(\mathbf{x}) $$

其中 $\mathbf{x}$ 是输入数据,$\mathbf{z}$ 是输出特征或预测,$\theta$ 是网络参数。

如果给神经网络一个目标函数,它就可以自动学习“怎样的特征对任务有用”。这正是语义通信最需要的能力:自动提取“语义”,而不是人工定义“语义”的编码表。

5.2 一个最简单的神经网络

人工神经元可以写成:

$$ z=\sigma\left(\sum_{i=1}^{n}w_i x_i+b\right) $$

写成向量形式:

$$ z=\sigma(\mathbf{w}^\top\mathbf{x}+b) $$

其中:

  • $\mathbf{x}$ 是输入;
  • $\mathbf{w}$ 是权重;
  • $b$ 是偏置;
  • $\sigma$ 是激活函数。

常用的激活函数:

  • ReLU:$\sigma(x)=\max(0,x)$
  • Sigmoid:$\sigma(x)=1/(1+e^{-x})$
  • Tanh:$\sigma(x)=\tanh(x)$
  • Softmax:将向量变成概率分布

多层感知机(MLP)就是多个神经元连成网络。第 $l$ 层可以记为:

$$ \mathbf{a}^{(l)}=\sigma\left(\mathbf{W}^{(l)}\mathbf{a}^{(l-1)}+\mathbf{b}^{(l)}\right) $$

5.3 为什么神经网络能学习:梯度与反向传播

训练目标是极小化损失:

$$ \mathcal{L}(\theta)=\frac{1}{N}\sum_{i=1}^{N}\ell(f_\theta(\mathbf{x}_i),y_i) $$

梯度下降更新:

$$ \theta\leftarrow \theta-\eta\nabla_\theta\mathcal{L}(\theta) $$

其中 $\eta$ 是学习率。

反向传播本质上是链式法则在计算图上的高效实现。如果损失是:

$$ \mathcal{L}=\ell(a_3),\quad a_3=h(a_2),\quad a_2=g(a_1),\quad a_1=f(\mathbf{x}) $$

则:

$$ \frac{\partial \mathcal{L}}{\partial \theta}=\frac{\partial \mathcal{L}}{\partial a_3}\frac{\partial a_3}{\partial a_2}\frac{\partial a_2}{\partial a_1}\frac{\partial a_1}{\partial \theta} $$

实际网络更深,但思路一样:从输出往输入反向求导。

5.4 损失函数:告诉网络“什么是好”

在分类任务中常用交叉熵:

$$ \mathcal{L}_{\mathrm{CE}}=-\sum_{c=1}^{C}y_c\log \hat{y}_c $$

其中 $\hat{y}_c$ 是模型预测类别 $c$ 的概率,$y_c$ 是真实标签的 one-hot 表示。

在回归或重建任务中常用均方误差:

$$ \mathcal{L}_{\mathrm{MSE}}=\frac{1}{N}\sum_{i=1}^{N}\|f_\theta(\mathbf{x}_i)-\hat{\mathbf{x}}_i\|^2 $$

对语义通信来说,损失函数可以不只是“重建得像不像”,还可以包含:

  • 分类/检测/翻译是否正确;
  • 语义向量是否相近;
  • 传输速率是否足够低;
  • 是否符合物理信道约束。

5.5 训练中的关键概念

  • 训练集、验证集、测试集:先训练,再调参,最后只测一次,避免“把测试集也学进去”。
  • 过拟合与欠拟合:过拟合是记住了训练数据,泛化差;欠拟合是模型太弱,训练误差也高。
  • 正则化:L2 正则化 $\lambda\|\theta\|^2$、dropout、早停、数据增强等,都是为了让模型更稳。
  • 学习率:太小收敛慢,太大可能发散。
  • 批量大小:影响梯度估计的方差和训练速度。
  • Adam:一种自适应学习率优化器,实践中广泛使用。

对语义通信的重要意义:训练数据分布、信道分布、任务分布都可能变化。一个只在特定信噪比下训练的语义编码器,可能在另一个信噪比下严重退化。这叫做“信道失配”或“分布漂移”。

5.6 卷积网络:处理图像和空间数据

卷积层对局部窗口做加权求和:

$$ Z_{i,j,k}=\sum_{c}\sum_{u}\sum_{v}W_{u,v,c,k}X_{i+u,j+v,c}+b_k $$

它在图像中体现“局部相关性”:相邻像素往往相关,卷积核可以学习边缘、纹理、形状等特征。

在卷积网络后,通常接池化层,例如最大池化:

$$ Y_{i,j}=\max_{u,v}X_{2i+u,2j+v} $$

池化降低分辨率、扩大感受野、减少计算量。

语义通信中的用途:图像语义编码常用卷积神经网络提取空间特征,再由解码器重建图像或直接输出任务结果。

5.7 循环网络与序列建模

循环神经网络(RNN)在每个时刻维护一个隐含状态:

$$ \mathbf{h}_t=f(\mathbf{W}_x\mathbf{x}_t+\mathbf{W}_h\mathbf{h}_{t-1}+\mathbf{b}) $$

它可以处理文本、语音、时间序列,但长距离依赖较弱。LSTM 和 GRU 通过门控机制缓解这个问题。

5.8 注意力机制与 Transformer

注意力机制的核心是:根据查询 Query 和键 Key 的相似度,对不同 Value 分配权重。

$$ \text{Attention}(Q,K,V)=\text{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right)V $$

其中:

  • $Q$:查询向量;
  • $K$:键向量;
  • $V$:值向量;
  • $d_k$:键向量的维度;
  • $\sqrt{d_k}$:缩放因子,防止点积过大导致梯度问题。

对语义通信的意义:Transformer 可以建模长文本、图像块、多模态之间的依赖。今天许多语义通信系统用预训练语言模型或视觉模型提取语义特征,再用轻量信道编码器传输。

5.9 自编码器:压缩的本质

自编码器由编码器和解码器组成:

$$ \mathbf{z}=f_\theta(\mathbf{x}),\qquad \hat{\mathbf{x}}=g_\phi(\mathbf{z}) $$

训练目标通常是:

$$ \mathcal{L}=\mathbb{E}[d(\mathbf{x},\hat{\mathbf{x}})] $$

如果 $\mathbf{z}$ 的维度远小于 $\mathbf{x}$,模型必须学会“保留最重要的信息”。这就是学习式压缩。

**变分自编码器(VAE)**引入一个潜在变量分布:

$$ q_\phi(\mathbf{z}\mid \mathbf{x}) $$

并通过最大化证据下界(ELBO)训练:

$$ \mathcal{L}_{\mathrm{VAE}}= \mathbb{E}_{q_\phi(\mathbf{z}\mid \mathbf{x})}[\log p_\theta(\mathbf{x}\mid\mathbf{z})] -D_{\mathrm{KL}}\bigl(q_\phi(\mathbf{z}\mid\mathbf{x})\,\|\,p(\mathbf{z})\bigr) $$

VAE 让潜在空间更光滑、可采样,因此常用于生成模型和语义压缩研究。

5.10 生成模型与预训练大模型

  • GAN:一个生成器试图骗过判别器,判别器试图区分真假。常用于图像生成、图像修复。
  • 扩散模型:从纯噪声逐步去噪得到数据。近年来在图像、视频生成中非常成功。
  • 自监督预训练:不依赖人工标签,而是通过预测掩码词、对比样本等任务学习表示。
  • 大语言模型(LLM):在海量文本上预训练,可以理解句子、生成回答、进行推理。

对语义通信的启发

  1. 大模型可以充当“共享知识”,发送方和接收方都可以利用它补齐缺失细节。
  2. 大模型可以生成新的内容,因此“语义传输”不必逐像素恢复,而可以是“传关键语义,接收方用先验生成”。
  3. 但也带来隐患:生成模型可能“补得太多”,生成出与事实不一致的内容,造成“语义幻觉”。

5.11 表示学习:把“意义”变成向量

表示学习的核心思想是:用一个高维向量表示一个对象,使相似对象在向量空间中靠近。

$$ \mathbf{v}(\text{“猫”})\approx \mathbf{v}(\text{“小猫”}),\qquad \mathbf{v}(\text{“猫”})\not\approx \mathbf{v}(\text{“狗”}) $$

常用的语义相似度是余弦相似度:

$$ \mathrm{sim}(\mathbf{u},\mathbf{v}) =\frac{\langle \mathbf{u},\mathbf{v}\rangle}{\|\mathbf{u}\|\|\mathbf{v}\|} $$

请区分两个词

  • 表示:某个对象的向量或特征(Representation)。
  • 语义:向量所代表的“意思”,它依赖于任务、上下文和接收方先验,不完全等于向量本身。

所以严格说,我们不是“找到唯一正确的语义向量”,而是“训练出一个对当前任务足够有效的表示”。

5.12 多模态表示

多模态表示学习把文本、图像、语音等不同模态映射到同一个语义空间。

例如 CLIP 学习图像和文本的联合表示:

$$ \mathrm{sim}(\mathbf{v}_{\text{image}},\mathbf{v}_{\text{text}}) $$

如果图片里有猫,图片向量与“a cat”文本向量的相似度会高于与“a dog”文本向量的相似度。

这对语义通信非常有用:发送端可以只传一种模态或部分语义,接收端利用另一模态的共享表示理解内容。

5.13 端到端训练与可微信道

传统网络直接可以端到端训练,但无线信道包含随机噪声和离散调制。为了让梯度能够回传,需要让信道“可微”:

  1. 对加性高斯噪声,直接加噪声就是可微的。
  2. 对 BPSK/QAM 等离散调制,常使用 Gumbel-Softmax、直通估计、或把符号当作连续值并在训练后量化。
  3. 对衰落信道,可以采样信道增益并让梯度通过信道模型。

这也解释了一个关键现象:很多深度学习语义通信系统在仿真中使用“可微信道模型”,但实际硬件中信道行为未必和仿真完全一致,所以鲁棒性研究非常重要。


第 5 章小结

  • 神经网络是一个可学习的映射,适合学习“什么特征对任务有用”。
  • 卷积适合图像,Transformer 适合序列/多模态,自编码器适合学习压缩。
  • 交叉熵、MSE、语义损失可以组合成端到端目标。
  • 表示学习把语义问题变成向量空间中的相似度问题。
  • 语义通信不仅是“用深度学习”,还要处理信道、先验、任务和泛化的关系。