基于大型多模态模型的任务导向语义通信在车辆网络中的应用
人工智能
2025-05-06 v1
摘要
任务导向语义通信已成为提高各种通信场景性能的基本方法。虽然近期的生成式人工智能(GenAI),如大型语言模型(LLM),已被应用于语义通信设计,但大型多模态模型(LMM)的潜力仍鲜有被探索。本文我们利用大型语言和视觉助手(LLaVA)构建一个基于 LMM 的车辆 AI 助手,提出一种任务导向语义通信框架以高效地促进用户与云服务器之间的交互。为减少计算需求和缩短响应时间,我们对 LLaVA 的图像切片进行优化,以 selectively focus on 用户最感兴趣的区域。此外,我们通过结合客观和主观用户注意力来评估图像块的重要性,调整传输语义信息的能源使用。该策略优化了资源利用,确保关键信息的精确传输。我们构建了一个用于交通场景的视觉问答(VQA)数据集来评估效果。实验结果显示,我们的语义通信框架在相同信道条件下显著提高了回答问题的准确率,尤其在信噪比(SNR)较差的环境中表现突出。在 SNR 为 12dB 时准确率提高 13.4%,在 10dB 时提高 33.1%。
引用
@article{arxiv.2505.02413,
title = {Task-Oriented Semantic Communication in Large Multimodal Models-based Vehicle Networks},
author = {Baoxia Du and Hongyang Du and Dusit Niyato and Ruidong Li},
journal= {arXiv preprint arXiv:2505.02413},
year = {2025}
}