中文

基于多模态基础模型的零样态语义通信

信号处理 2025-05-30 v2

摘要

现有大多数语义通信(SemCom)系统使用深度联合源信道编码(DeepJSCC)以任务为导向地编码语义信息。然而,其依赖预定义任务和数据集显著限制了实际部署中的灵活性和可泛化性。多模态基础模型通过生成通用语义标记提供了可行方案。受此启发,我们引入SemCLIP,一个基于对比语言-图像预训练(CLIP)模型的零样态 SemCom 框架。通过传输 CLIP 生成的图像标记而非原始图像,SemCLIP 实现了在低带宽和恶劣信道条件下的高效语义通信,支持多样化下游任务和零样态应用。具体而言,我们提出了高效 CLIP 标记编码的 DeepJSCC 方案。为抵消压缩和信道噪声可能导致的性能下降,设计了基于多模态传输感知的接收端提示学习机制,根据传输质量自适应调整提示,增强系统鲁棒性和信道适应性。仿真结果表明,SemCLIP 在低信噪比条件下零样态性能优于基线方法,提升了 41%41\%;同时,SemCLIP 比替代图像传输方法节省带宽Usage超过 5050 倍,展示了基础模型向通用、任务无关 SemCom 解决方案的潜力。

关键词

引用

@article{arxiv.2502.18200,
  title  = {Zero-Shot Semantic Communication with Multimodal Foundation Models},
  author = {Jiangjing Hu and Haotian Wu and Wenjing Zhang and Fengyu Wang and Wenjun Xu and Hui Gao and Deniz Gündüz},
  journal= {arXiv preprint arXiv:2502.18200},
  year   = {2025}
}