中文

V2V-LLM: 基于多模态大语言模型的车联网协作自动驾驶

计算机视觉与模式识别 2026-02-17 v4 机器人学

摘要

当前的自动驾驶车辆主要依赖自身传感器来理解周围场景并规划未来轨迹, 当传感器故障或被遮挡时,这种依赖方式可能不可靠。 为解决这一问题,人们提出了通过车联网(V2V)通信进行的协作感知方法,但这些方法往往侧重于检测或跟踪等感知任务。 如何评估这些方法对整体协作规划性能的贡献仍有待探索。 受最近利用大语言模型(LLM)构建自动驾驶系统取得进展的启发,我们提出一种新颖的Problem Setting,将多模态LLM集成到协作自动驾驶中,并构建了车联网问答(V2V-QA)数据集和基准。 我们还提出了基线方法车联网多模态大语言模型(V2V-LLM),该方法利用LLM融合来自多个连接的自动驾驶车辆(CAV)的感知信息,并回答各种类型的驾驶相关问题:定位、显著物体识别和规划。 实验结果表明,我们提出的V2V-LLM可以成为协作自动驾驶中执行各种任务的有前景的统一模型架构, 并优于使用不同融合方法的其他基线方法。 我们工作还创造了一种可以提高未来自动驾驶系统安全性的新研究方向。 代码和数据将公开发布以促进该领域的开源研究。 我们的项目网站:https://eddyhkchiu.github.io/v2vllm.github.io/ 。

关键词

引用

@article{arxiv.2502.09980,
  title  = {V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models},
  author = {Hsu-kuang Chiu and Ryo Hachiuma and Chien-Yi Wang and Stephen F. Smith and Yu-Chiang Frank Wang and Min-Hung Chen},
  journal= {arXiv preprint arXiv:2502.09980},
  year   = {2026}
}

备注

Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA