基于最大安全概率学习的自主漂移
机器人学
2024-09-06 v1 系统与控制
系统与控制
摘要
本文提出了一种基于最大安全概率概念的全新学习型自动驾驶框架。高效的学习需要能够提供关于期望/不期望状态信息的奖励,但由于难以在众多安全状态中区分出更好的状态,手动设计此类奖励极具挑战性。另一方面,最大化安全概率的学习策略不需要繁琐的奖励塑形,但在数值上具有挑战性,因为算法必须基于在时间上稀疏的二元奖励来优化策略。在此,我们表明物理信息强化学习能够高效地学习这种形式的最大安全策略。与现有的漂移控制方法不同,我们的方法不需要特定的参考轨迹或复杂的奖励塑形,并且仅从稀疏的二元奖励中就能学习安全行为。这是通过使用物理损失来实现的,其发挥了类似于奖励塑形的作用。通过在正常转弯场景下的车道保持和高速赛车场景下的安全漂移,展示了所提方法的有效性。
引用
@article{arxiv.2409.03160,
title = {Autonomous Drifting Based on Maximal Safety Probability Learning},
author = {Hikaru Hoshino and Jiaxing Li and Arnav Menon and John M. Dolan and Yorie Nakahira},
journal= {arXiv preprint arXiv:2409.03160},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2403.16391