中文

SA-OOSC:一种基于多模态 LLM 蒸馏的语义通信框架,通过场景理解增强编码效率

信号处理 2025-09-10 v1

摘要

本文介绍了 SA-OOSC,这是一种多模态大语言模型(MLLM)蒸馏的语义通信框架,通过场景感知的重要性分配实现高效的语义编码。该方法解决了现有面向对象语义通信(OOSC)系统的一个关键局限性——无论上下文相关性如何,都为特定类别的对象分配静态重要性值。我们的框架利用 MLLM 来识别图像中对象的场景增强(SA)语义重要性。通过使用 MLLM 标注的数据进行知识蒸馏,我们的矢量化/去矢量化网络和 JSCC 编码器/解码器学会了根据上下文重要性动态分配编码资源,即根据任务的 SA 场景信息区分高重要性对象和低重要性对象。该框架具有三项核心创新:MLLM 引导的知识蒸馏流程、重要性加权变长 JSCC 框架,以及促进 JSCC 框架内知识蒸馏的新颖损失函数设计。实验验证表明,我们的框架在编码效率上优于传统语义通信系统,同时建立了开源的 MLLM 标注和人工验证的数据集,作为未来语义通信研究的新基准。

关键词

引用

@article{arxiv.2509.07436,
  title  = {SA-OOSC: A Multimodal LLM-Distilled Semantic Communication Framework for Enhanced Coding Efficiency with Scenario Understanding},
  author = {Feifan Zhang and Yuyang Du and Yifan Xiang and Xiaoyan Liu and Soung Chang Liew},
  journal= {arXiv preprint arXiv:2509.07436},
  year   = {2025}
}