工作区域挑战VLM轨迹规划:面向缓解与稳健的自动驾驶
机器人学
2025-10-06 v1 人工智能
计算机视觉与模式识别
摘要
视觉语言模型(VLM)凭借强大的多模态推理能力,正逐步被整合到自动驾驶系统中,以提升在具备挑战性环境中的规划能力。然而,VLM在工作区域内的轨迹规划能力仍未得到探索,因为工作区域常包含不规则布局、临时交通控制以及动态变化的几何结构。为弥合这一差距,我们开展了首个系统性研究,旨在评估VLM在工作区域轨迹规划中的表现,结果显示其在68.0%的情况下无法生成正确轨迹。为更好理解这些失效原因,我们首先通过子图挖掘和聚类分析识别候选模式,然后通过人工验证确认8种常见失效模式的有效性。基于上述发现,我们提出了REACT-Drive——一种集成VLM与检索增强生成(RAG)的轨迹规划框架。具体而言,REACT-Drive利用VLM将先前的失效案例转化为约束规则和可执行轨迹规划代码,而RAG则检索新情境中的相似模式以指导轨迹生成。在使用Qwen2.5-VL评估ROADWork数据集的实验结果表明,REACT-Drive相较于VLM基线方法可将平均位移误差降低约3倍。此外,REACT-Drive的推理时间(0.58秒)远低于其他方法(如微调为17.90秒)。我们进一步在15个实际工作场景中使用实车进行实验,证明了REACT-Drive的强大实用性。
引用
@article{arxiv.2510.02803,
title = {Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving},
author = {Yifan Liao and Zhen Sun and Xiaoyun Qiu and Zixiao Zhao and Wenbing Tang and Xinlei He and Xinhu Zheng and Tianwei Zhang and Xinyi Huang and Xingshuo Han},
journal= {arXiv preprint arXiv:2510.02803},
year = {2025}
}
备注
13 pages,5 figures