基于 ViT 和 LLM 的语义边云通信在移动网络下的实时城市交通监控
网络与互联网体系结构
2025-09-26 v1 人工智能
摘要
实时城市交通监控对智能交通系统(ITS)至关重要,有助于确保道路安全、优化交通流量、跟踪车辆轨迹并预防碰撞。在城市环境中部署边缘摄像机是监控道路状况的标准做法。然而,将其与智能模型集成需要对动态交通情景进行深入理解,并提供用户交互的响应式界面。虽然多模态大语言模型(LLM)能够解释交通图像并生成信息丰富的响应,但由于计算需求高,无法在边缘设备上部署。因此,必须在云端进行 LLM 推理,这需要将边缘端的视觉数据传输到云端,而这一过程受限于带宽,可能导致延迟,妨碍实时性能。为解决此挑战,我们提出了一种显著降低传输开销的语义通信框架。该方法利用 YOLOv11 检测感兴趣区域(RoI),裁剪相关图像片段,并使用 Vision Transformer(ViT) 将其转换为紧凑的嵌入向量。这些嵌入向量传输到云端,在那里图像解码器会重建裁剪后的图像。随后,多模态 LLM 处理这些重建图像,以生成交通状况描述。该方法在数据传输规模上实现了 99.9% 的降低,同时保持对重建裁剪图像的 LLM 响应准确率为 89%(相对于原始裁剪图像的 93% 准确率)。我们的结果表明,ViT 和 LLM 辅助的边云语义通信在实时交通监控方面具有高效且实用的特性。
引用
@article{arxiv.2509.21259,
title = {Semantic Edge-Cloud Communication for Real-Time Urban Traffic Surveillance with ViT and LLMs over Mobile Networks},
author = {Murat Arda Onsu and Poonam Lohan and Burak Kantarci and Aisha Syed and Matthew Andrews and Sean Kennedy},
journal= {arXiv preprint arXiv:2509.21259},
year = {2025}
}
备注
17 pages, 12 figures