中文

LaViPlan:基于 RLVR 的语言引导视觉路径规划

机器人学 2025-08-21 v4 机器学习

摘要

自动驾驶中的域外(OOD)场景构成关键挑战,因为规划器往往无法超越训练经验,导致不安全或意外行为。视觉语言模型(VLM)在处理此类场景方面显示出前景,通过提供高层次的场景理解和用户对齐决策。然而,现有 VLM 常常在其基于语言的推理与实际行动所需的低层轨迹之间存在偏差。在本文中,我们提出 LaViPlan 框架,利用可验证奖励的强化学习(RLVR)对 VLM 进行微调,使用规划导向的指标。实验结果表明,LaViPlan 在包括在域内和域外数据集在内的多个场景中均显著提升了规划性能。尽管 RLVR 基于微调后语言忠实度略有下降,但定性评估表明,其输出仍保持连贯。我们还进行了消融实验,分析了抽样比例和推理引导的影响,揭示了这些设计选择如何影响性能。这些发现表明,RLVR 作为一种后训练范式,具有潜力用于将语言引导的推理与自动驾驶中的行动级规划对齐。

关键词

引用

@article{arxiv.2507.12911,
  title  = {LaViPlan : Language-Guided Visual Path Planning with RLVR},
  author = {Hayeon Oh},
  journal= {arXiv preprint arXiv:2507.12911},
  year   = {2025}
}

备注

Accepted to the 2nd ICCV 2025 Workshop on the Challenge of Out-of-Label Hazards in Autonomous Driving (13 pages, 6 figures)