WorldRFT:面向自动驾驶的基于强化学习微调的潜在世界模型规划
机器人学
2025-12-23 v1 计算机视觉与模式识别
摘要
潜在世界模型通过时序自监督学习增强场景表示,为端到端自动驾驶提供了无需感知标注的范式。然而,重构导向的表示学习将感知与规划任务交织在一起,导致规划优化次优。为解决这一挑战,我们提出了 WorldRFT,一种通过层次规划分解和局部感知交互细化机制,辅以强化学习微调(RFT)来增强安全关键策略性能的规划导向潜在世界模型框架。具体而言,WorldRFT 集成了视觉-几何基础模型以提高 3D 空间感知能力,采用层次规划任务分解引导表示优化,并利用局部感知迭代细化推导出规划导向的驾驶策略。此外,我们引入了群相对策略优化(GRPO),其应用轨迹高斯化和碰撞感知奖励来微调驾驶策略,显著提升了安全性。WorldRFT 在 nuScenes 和 NavSim 两个开放式基准测试上实现了最新(SOTA)性能。nuScenes 上将碰撞率降低 83%(0.30% -> 0.05%)。NavSim 上使用仅摄像头传感器输入,达到了与基于激光雷达的 SOTA 方法 DiffusionDrive(87.8 vs. 88.1 PDMS)相当的性能。
引用
@article{arxiv.2512.19133,
title = {WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving},
author = {Pengxuan Yang and Ben Lu and Zhongpu Xia and Chao Han and Yinfeng Gao and Teng Zhang and Kun Zhan and XianPeng Lang and Yupeng Zheng and Qichao Zhang},
journal= {arXiv preprint arXiv:2512.19133},
year = {2025}
}
备注
AAAI 2026, first version