CIMRL: 结合模仿学习与强化学习实现安全自动驾驶
机器学习
2024-11-12 v4
摘要
现代自动驾驶方法严重依赖于通过模仿学习使用大量人类驾驶数据训练的组件。然而,这些方法需要大量昂贵的数据收集,并且在安全处理长尾场景和随时间累积的复合误差方面仍面临挑战。同时,纯粹的强化学习(RL)方法在稀疏、受限且难以定义奖励的设置(如自动驾驶)中可能无法学习到高性能策略。这两个挑战使得在自动驾驶汽车等安全关键应用中部署纯克隆或纯 RL 策略变得困难。在本文中,我们提出了结合模仿与强化学习(CIMRL)方法——一个安全的强化学习框架,通过利用模仿运动先验和安全约束,能够在仿真中训练驾驶策略。CIMRL 不需要广泛的奖励规范,并改进了纯克隆方法的闭环行为。通过结合 RL 和模仿,我们证明了我们的方法在闭环仿真和真实世界驾驶基准测试中取得了最先进的结果。
引用
@article{arxiv.2406.08878,
title = {CIMRL: Combining IMitation and Reinforcement Learning for Safe Autonomous Driving},
author = {Jonathan Booher and Khashayar Rohanimanesh and Junhong Xu and Vladislav Isenbaev and Ashwin Balakrishna and Ishan Gupta and Wei Liu and Aleksandr Petiushko},
journal= {arXiv preprint arXiv:2406.08878},
year = {2024}
}