利用多模态大语言模型应对图像语义通信系统中的分布外挑战
信号处理
2024-07-23 v1
摘要
语义通信是下一代无线网络的一项有前景的技术。然而,分布外(OOD)问题——即预训练的机器学习(ML)模型被应用于其训练数据分布之外的未见任务——可能会损害语义压缩的完整性。本文探讨了使用多模态大语言模型(MLLM)来解决图像语义通信中的OOD问题。我们提出了一种新颖的“Plan A - Plan B”框架,该框架利用MLLM的广泛知识和强大的泛化能力,在传统ML模型在语义编码过程中遇到OOD输入时为其提供辅助。此外,我们提出了一种贝叶斯优化方案,该方案根据图像的上下文信息重塑MLLM推理过程的概率分布。该优化方案通过以下方式显著增强了MLLM在语义压缩中的性能:1)过滤掉原始MLLM输出中不相关的词汇;2)利用MLLM预期答案与背景信息之间的上下文相似性作为先验知识,在推理过程中修改MLLM的概率分布。此外,在通信系统的接收端,我们提出了一个“生成-批评”框架,该框架利用多个MLLM的协作来增强图像重建的可靠性。
引用
@article{arxiv.2407.15335,
title = {Addressing Out-of-Distribution Challenges in Image Semantic Communication Systems with Multi-modal Large Language Models},
author = {Feifan Zhang and Yuyang Du and Kexin Chen and Yulin Shao and Soung Chang Liew},
journal= {arXiv preprint arXiv:2407.15335},
year = {2024}
}