Poutine:面向稳健端到端自动驾驶的视觉-语言-轨迹预训练与强化学习后训练
机器人学
2025-11-07 v4 计算机视觉与模式识别
摘要
在分布之外的场景中保持良好的驾驶行为是自动驾驶中的关键挑战。一个有前景的方向是通过将异常驾驶场景视为逻辑推理任务,利用大型语言模型的通用知识和推理能力。本文提出了Poutine方法,利用即插即用的3B参数视觉-语言模型(VLM)——无需任何额外组件——通过简单可扩展的训练配方实现稳健的端到端自动驾驶。为学习强大的基础驾驶能力,我们首先使用自监督的下一个标记预测训练Poutine-Base,涵盖视觉、语言和轨迹(VLT)标记,利用正式和长尾驾驶数据。在第二个阶段,我们使用小型人类偏好标注示例通过Group Relative Policy Optimization(GRPO)对Poutine-Base进行微调。我们在为长尾场景精选的Waymo端到端驾驶基准测试中对方法进行评估。最终的Poutine模型在测试集上实现了7.99的RFS评分,位列2025年Waymo基于视觉的端到端驾驶挑战赛第一名,取得显著优势。我们的结果表明,针对基础VLM在先前工作中添加的手工标记器或自定义架构组件并非实现卓越驾驶性能的必要条件。相反,本工作凸显了可扩展VLT预训练结合轻量级RL微调以实现稳健和可泛化自动驾驶的潜力。
引用
@article{arxiv.2506.11234,
title = {Poutine: Vision-Language-Trajectory Pre-Training and Reinforcement Learning Post-Training Enable Robust End-to-End Autonomous Driving},
author = {Luke Rowe and Rodrigue de Schaetzen and Roger Girgis and Christopher Pal and Liam Paull},
journal= {arXiv preprint arXiv:2506.11234},
year = {2025}
}