基于大型视觉语言模型的端到端 V2X 协作自动驾驶
机器人学
2025-06-23 v3 人工智能
机器学习
摘要
车联网 (V2X) 协作已成为一种突破传统自动驾驶感知局限性的有前景的范式, 通过利用 ego-vehicle 和基础设施传感器的信息。然而, 在确保鲁健轨迹规划的前提下,有效融合异构的视觉和语义信息仍然是一个重大挑战。本文引入 V2X-VLM,一个基于视觉语言模型 (VLM) 的新型端到端 (E2E) 协作自动驾驶框架。V2X-VLM 将来自车辆和基础设施的多视角摄像头视图与基于文本的场景描述相结合,以实现对驾驶环境的更全面理解。具体而言,我们提出了一种基于对比学习的机制,以强化异构视觉和文本特征的对齐,从而增强对复杂驾驶情景的语义理解,并采用知识蒸馏策略来稳定训练。在大型真实世界数据集上的实验表明,V2X-VLM 实现了轨迹规划的领先性能,显著降低了 L2 误差和碰撞率,优于现有的协作自动驾驶基线方法。消融研究验证了每个组件的贡献。此外,对鲁健性和效率的评估突显了 V2X-VLM 在实际部署中提升整体自动驾驶安全性和决策能力的实用性。
引用
@article{arxiv.2408.09251,
title = {V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models},
author = {Junwei You and Haotian Shi and Zhuoyu Jiang and Zilin Huang and Rui Gan and Keshu Wu and Xi Cheng and Xiaopeng Li and Bin Ran},
journal= {arXiv preprint arXiv:2408.09251},
year = {2025}
}