中文

RAD:基于大规模 3DGS 的强化学习训练端到端驾驶策略

计算机视觉与模式识别 2025-10-22 v2 机器人学

摘要

现有的端到端自动驾驶(AD)算法通常遵循模仿学习(IL)范式,面临因果混淆和开环差距等挑战。本文提出 RAD,一个基于 3DGS 的闭环强化学习(RL)端到端自动驾驶框架。通过利用 3DGS 技术,我们构建了真实物理世界的照片级真实数字副本,使 AD 策略能够广泛探索状态空间,并通过大规模试错学习处理分布外场景。为增强安全性,我们设计了专门的奖励,以引导策略有效应对安全关键事件并理解现实世界的因果关系。为更好地与人类驾驶行为对齐,我们将 IL 作为正则化项纳入 RL 训练。我们引入了一个由多样化、前所未见的 3DGS 环境组成的闭环评估基准。与基于 IL 的方法相比,RAD 在大多数闭环指标上取得了更强的性能,特别是碰撞率降低了 3 倍。补充材料中提供了丰富的闭环结果。代码可在 https://github.com/hustvl/RAD 获取,以促进未来研究。

关键词

引用

@article{arxiv.2502.13144,
  title  = {RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning},
  author = {Hao Gao and Shaoyu Chen and Bo Jiang and Bencheng Liao and Yiang Shi and Xiaoyang Guo and Yuechuan Pu and Haoran Yin and Xiangyu Li and Xinbang Zhang and Ying Zhang and Wenyu Liu and Qian Zhang and Xinggang Wang},
  journal= {arXiv preprint arXiv:2502.13144},
  year   = {2025}
}

备注

Code: https://github.com/hustvl/RAD