中文

VLM-Auto:基于视觉语言模型的具备人类行为与理解能力的自动驾驶辅助系统

机器人学 2024-10-03 v3

摘要

最近的大语言模型自动驾驶研究在规划与控制方面显示出前景,但高计算需求与幻觉现象仍挑战准确的轨迹预测与控制信号生成。确定性算法虽可靠,但缺乏对复杂驾驶情景的适应性,难以处理情境与不确定性。为此,我们提出VLM-Auto,一种新型自动驾驶辅助系统,旨在通过理解路面场景赋予自动驾驶车辆可调节的驾驶行为。本文介绍了包含CARLA仿真器与机器人操作系统2(ROS2)的管道,用于验证系统有效性,仅需单张NVIDIA 4090 24G GPU,充分利用视觉语言模型(VLM)文本输出能力。此外,我们还贡献了一个包含图像集与对应提示集的数据集,用于微调系统的VLM模块。在CARLA实验中,系统在数据集中5类标签上实现了97.82%的平均精度。在真实道路驾驶数据集中,系统在夜间场景与昏暗场景下实现了96.97%的预测准确率。我们的VLM-Auto数据集将发布于https://github.com/ZionGo6/VLM-Auto。

关键词

引用

@article{arxiv.2405.05885,
  title  = {VLM-Auto: VLM-based Autonomous Driving Assistant with Human-like Behavior and Understanding for Complex Road Scenes},
  author = {Ziang Guo and Zakhar Yagudin and Artem Lykov and Mikhail Konenkov and Dzmitry Tsetserukou},
  journal= {arXiv preprint arXiv:2405.05885},
  year   = {2024}
}

备注

The paper is accepted by the IEEE conference