中文

基于潜在扩散模型的多模态生成式语义通信框架

计算机视觉与模式识别 2024-08-13 v1 网络与互联网体系结构

摘要

在紧急情况下,快速且准确地收集环境数据和命令信息,并作出及时决策的能力尤为关键。 传统的语义通信框架主要基于单一模态,易受复杂环境和光照条件的影响,从而限制决策精度。 为此,本文引入一种名为mm-GESCO的多模态生成式语义通信框架。 该框架输入可见光和红外模态图像数据流,生成融合后的语义分割图,并采用一种结合独热编码和zlib压缩技术的传输方式来提高数据传输效率。 在接收端,该框架可基于语义图重建原始多模态图像。 此外,设计了一种基于对比学习的潜在扩散模型,用于在潜在空间中对齐不同模态的数据,使mm-GESCO能够重建输入时出现的任意模态的潜在特征。 实验结果表明,mm-GESCO实现了最高可达200倍的压缩比,超越了现有语义通信框架的性能,在目标分类和检测等下游任务中表现优异。

引用

@article{arxiv.2408.05455,
  title  = {Multimodal generative semantic communication based on latent diffusion model},
  author = {Weiqi Fu and Lianming Xu and Xin Wu and Haoyang Wei and Li Wang},
  journal= {arXiv preprint arXiv:2408.05455},
  year   = {2024}
}