基于伪专家正则化的离线强化学习用于光栅环境下的端到端自动驾驶
机器人学
2026-04-10 v2 计算机视觉与模式识别
摘要
仅依赖摄像头图像输入并直接预测未来轨迹的端到端(E2E)自动驾驶模型因其计算效率高且通过统一优化实现更好泛化的潜力而备受青睐;然而,由于依赖模仿学习(IL),仍存在持续的失效模式。虽然在线强化学习(RL)可缓解IL引发的问题,但神经渲染基模拟和大型E2E网络的计算负担,使得迭代奖励和超参数调优成本高昂。我们引入一种仅使用摄像头的E2E离线RL框架,该框架无需额外探索,仅基于固定的模拟器数据集进行训练。离线RL提供了强大的数据效率和快速的实验迭代能力,但容易因对超出分布(OOD)动作的高估而产生不稳定。为此,我们从专家驾驶日志中构建伪地面真相轨迹,并将其用作行为正则化信号,以抑制对不安全或次优行为的模仿,同时稳定价值学习。在从公共nuScenes数据集中学习的神经渲染环境中进行训练和闭环评估。经验地面,所提出的方法在碰撞率和路径完成率方面显著优于IL基线。我们的代码可在https://github.com/ToyotaInfoTech/PEBC 获取。
引用
@article{arxiv.2512.18662,
title = {Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments},
author = {Chihiro Noguchi and Takaki Yamamoto},
journal= {arXiv preprint arXiv:2512.18662},
year = {2026}
}
备注
Accepted to CVPR Findings 2026