中文

ZTRS:基于轨迹评分的零模仿端到端自动驾驶

机器人学 2025-10-29 v1 计算机视觉与模式识别

摘要

端到端自动驾驶将原始传感器输入直接映射到 ego-vehicle 轨迹,以避免感知模块带来的级联误差并利用丰富的语义线索。现有框架大多依赖模仿学习(Imitation Learning, IL),该方法可能受次优专家演示和部署期间协变量漂移的限制。另一方面,强化学习(Reinforcement Learning, RL)最近在仿真中显示出规模化潜力,但通常局限于低维符号输入(如 3D 对象和地图),难以实现从原始传感器数据的全端到端学习。我们引入 ZTRS(Zero-Imitation End-to-End Autonomous Driving with Trajectory Scoring),一个结合两者优势的框架:保留传感器输入的信息,同时进行强化学习以实现稳健的规划。就我们所知,ZTRS 是首个完全消除 IL,仅通过奖励学习、直接处理高维传感器数据的框架。ZTRS 利用离线强化学习,我们提出的穷尽策略优化(Exhaustive Policy Optimization, EPO)是针对可枚举动作和奖励的策略梯度变体。ZTRS 在三个基准测试中表现突出:Navtest(通用真实世界开环规划)、Navhard(在挑战性真实世界和合成场景中的开环规划)以及 HUGSIM(仿真闭环驾驶)。具体而言,ZTRS 在 Navhard 上取得最先进成绩,并在 HUGSIM 上超越基于 IL 的基线。代码将在 https://github.com/woxihuanjiangguo/ZTRS 上公开。

关键词

引用

@article{arxiv.2510.24108,
  title  = {ZTRS: Zero-Imitation End-to-end Autonomous Driving with Trajectory Scoring},
  author = {Zhenxin Li and Wenhao Yao and Zi Wang and Xinglong Sun and Jingde Chen and Nadine Chang and Maying Shen and Jingyu Song and Zuxuan Wu and Shiyi Lan and Jose M. Alvarez},
  journal= {arXiv preprint arXiv:2510.24108},
  year   = {2025}
}