在安全关键驾驶场景中利用无模型强化学习自动学习回退策略
机器学习
2022-04-12 v1
摘要
当学习在安全性至关重要的随机环境(如交通中驾驶车辆)中行动时,人类驾驶员自然会规划回退策略作为备份,以应对环境中出现意外变化的情况。预知意外并为之规划,提升了我们对未见场景的鲁棒性,并可能有助于防止灾难性故障。自动驾驶车辆(AV)的控制尤其关注于知晓何时及如何使用回退策略以保障安全。由于AV对其环境可获取的信息不完善,随时备有未必能从原始训练数据分布推导出的替代策略十分重要。本文中,我们提出一种原则性方法,使无模型强化学习(RL)智能体能够捕捉环境中的多种行为模式。我们在奖励模型中引入额外的伪奖励项,以鼓励向不同于最优策略所偏好的状态空间区域进行探索。该奖励项基于智能体轨迹间的距离度量,以迫使策略关注与初始探索智能体不同的状态空间区域。全文将这一特定训练范式称为学习回退策略。我们将该方法应用于自动驾驶场景,并表明我们能够学到原本在训练中会被遗漏、在执行控制算法时无法使用的有用策略。
引用
@article{arxiv.2204.05196,
title = {Automatically Learning Fallback Strategies with Model-Free Reinforcement Learning in Safety-Critical Driving Scenarios},
author = {Ugo Lecerf and Christelle Yemdji-Tchassi and Sébastien Aubert and Pietro Michiardi},
journal= {arXiv preprint arXiv:2204.05196},
year = {2022}
}
备注
To appear in proceedings of International Conference on Machine Learning Technologies (ICMLT) 2022