基于视觉语言模型的跨模态语义通信系统
计算机视觉与模式识别
2024-07-02 v1 人工智能
计算与语言
信息论
机器学习
math.IT
摘要
语义通信 (SC) 近年来已成为一种新兴的通信范式,成功突破了香港物理容量限制,通过创新的语义传输概念实现。然而,现有的图像语义通信 (ISC) 系统在动态环境中面临诸多挑战,包括语义密度低、灾难性遗忘以及信噪比 (SNR) 不确定。为此,我们提出了一种新的基于视觉语言模型的跨模态语义通信 (VLM-CSC) 系统。VLM-CSC 由三个新组件构成:(1) 跨模态知识库 (CKB) 用于从语义稀疏的图像中提取高密度文本语义,并在接收端基于文本语义重建原始图像。高密度语义的传输有助于减轻带宽压力。(2) 记忆辅助的编码器和解码器 (MED) 采用混合的长期/短期记忆机制,使语义编码器和解码器在语义特征分布漂移时能够克服动态环境中的灾难性遗忘。(3) 噪声注意力模块 (NAM) 采用注意力机制,根据 SNR 自适应调整语义编码和信道编码,确保 CSC 系统的鲁健性。实验仿真验证了该通信系统的有效性、适应性和鲁健性。
引用
@article{arxiv.2407.00020,
title = {Visual Language Model based Cross-modal Semantic Communication Systems},
author = {Feibo Jiang and Chuanguo Tang and Li Dong and Kezhi Wang and Kun Yang and Cunhua Pan},
journal= {arXiv preprint arXiv:2407.00020},
year = {2024}
}
备注
12 pages, 10 figures