基于时不变空间对齐和多目标策略精炼的自回归端到端规划
机器人学
2025-09-26 v1 计算机视觉与模式识别
摘要
自回归模型的内在序列建模能力使其成为自动驾驶中端到端规划的强大基线。然而,其性能受限于时空错位,因为规划器必须以过去的感知数据为条件来预测未来的动作。这导致了世界观的不一致,限制了这一强大方法的性能上限。为此,我们提出了时不变空间对齐(TISA)模块,该模块学习将初始环境特征映射到每个未来时间步的一致 ego 坐标系,从而在不进行显式未来场景预测的情况下纠正智能体的世界观。此外,我们采用运动学动作预测头(即加速度和偏航率)以确保物理可行的轨迹。最后,我们引入了基于直接偏好优化(DPO)的多目标后训练阶段,以超越纯模仿。我们的 approach 提供了针对特定驾驶行为的反馈,相对于标准 DPO 使用的单一整体目标,提供了更细粒度的学习信号。我们的模型在 autoregressive 模型中实现了 NAVSIM 数据集上的最新 89.8 PDMS。视频文档可在 https://tisa-dpo-e2e.github.io/ 查看。
引用
@article{arxiv.2509.20938,
title = {Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement},
author = {Jianbo Zhao and Taiyu Ban and Xiangjie Li and Xingtai Gui and Hangning Zhou and Lei Liu and Hongwei Zhao and Bin Li},
journal= {arXiv preprint arXiv:2509.20938},
year = {2025}
}