中文

基于多模态大语言模型的车联基础设施协同空间感知

机器学习 2025-09-05 v1 信息论 math.IT

摘要

准确预测通信链路质量指标对于车联网(V2I)系统至关重要,以实现顺畅的切换、高效的波束管理以及可靠的低延迟通信。现代车辆日益增多的传感器数据激发了使用多模态大语言模型(MLLMs)的动机,因为它们在跨任务和推理方面具有适应性。然而,MLLMs本质上缺乏三维空间理解。为克服这一限制,本文提出了一种轻量级、即插即用的鸟瞰图(BEV)注入连接器。在该框架中,由收集相邻车辆的感知数据构建环境的鸟瞰图。该鸟瞰图表示随着自车输入融合,为大语言模型提供空间上下文。为支持现实的多模态学习,开发了一个结合CARLA仿真器和基于MATLAB的射线追踪的协仿真环境,用于生成RGB、LiDAR、GPS和无线信号数据,并覆盖各种场景。从射线追踪输出中程序化地提取指令和ground-truth响应。开展了广泛的实验,涵盖三项车联网链路预测任务:视线(LoS)与非视线(NLoS)分类、链路可用性以及阻塞预测。仿真结果表明,所提出的鸟瞰图注入框架在所有任务中均一致地提高了性能。结果表明,与仅限于自车的基线相比,所提出的方法在准确度指标上提高了最高达13.9%的宏观平均值。在恶劣的雨天和夜间条件下,性能提升可达32.7%,确认了该框架在不利环境下的鲁棒性。

关键词

引用

@article{arxiv.2509.03837,
  title  = {Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models},
  author = {Kimia Ehsani and Walid Saad},
  journal= {arXiv preprint arXiv:2509.03837},
  year   = {2025}
}

备注

Accepted at IEEE GLOBECOM 2025