以最少人为干预训练自动驾驶车辆的自主算法
机器人学
2025-01-17 v2 机器学习
摘要
最近的强化学习算法在模拟驾驶环境中展示了令人印象深刻的结果。然而,由于模拟环境与现实世界环境之间的保真度差距,在模拟中训练的自动驾驶车辆通常难以在现实世界中良好工作。虽然直接用 RL 算法训练现实世界的自动驾驶车辆是绕过保真度差距问题的一种有前景的方法,但它带来了几个挑战。一个关键但经常被忽视的挑战是需要在每个回合之间重置驾驶环境。这个重置过程需要大量的人为干预,导致现实世界中的训练效率低下。在本文中,我们介绍了一种新颖的自主算法,该算法使现成的 RL 算法能够在最少人为干预的情况下训练自动驾驶车辆。我们的算法通过中止回合以防止不安全状态,并为后续回合识别信息丰富的初始状态,从而减少不必要的人为干预。识别信息丰富初始状态的关键思想是估计可以从探索不足但可达状态中获得的预期信息量。我们的算法还重新审视了基于规则的自动驾驶算法,并强调了它们在安全地将自动驾驶车辆返回到初始状态方面的优势。为了评估训练过程中需要多少人为干预,我们实现了具有挑战性的城市驾驶任务,要求自动驾驶车辆自行重置到初始状态。实验结果表明,我们的自主算法是任务无关的,并且以比基线少得多的人为干预实现了有竞争力的驾驶性能。
引用
@article{arxiv.2405.13345,
title = {Autonomous Algorithm for Training Autonomous Vehicles with Minimal Human Intervention},
author = {Sang-Hyun Lee and Daehyeok Kwon and Seung-Woo Seo},
journal= {arXiv preprint arXiv:2405.13345},
year = {2025}
}
备注
8 pages, 6 figures, 2 tables, conference