SafeRL-Kit:面向安全自动驾驶的高效强化学习方法评测
机器学习
2022-06-20 v1 人工智能
机器人学
摘要
安全强化学习(RL)在风险敏感任务上已取得显著成功,并在自动驾驶(AD)中展现出前景。考虑到该领域的独特性,目前仍缺乏面向安全 AD 的高效且可复现的基线。本文中,我们发布 SafeRL-Kit 以对 AD 导向任务的安全 RL 方法进行基准测试。具体而言,SafeRL-Kit 包含若干针对零约束违反任务的最新算法,包括 Safety Layer、Recovery RL、离策略拉格朗日方法以及 Feasible Actor-Critic。除现有方法外,我们提出一种名为精确惩罚优化(EPO)的新颖一阶方法,并充分展示了其在安全 AD 中的能力。SafeRL-Kit 中的所有算法均实现为:(i)离策略设定,提升了样本效率并更好地利用过往日志;(ii)统一学习框架,为研究者提供即用接口,将其领域知识融入基础安全 RL 方法。最后,我们在 SafeRL-Kit 中对上述算法进行对比评估,并阐明其在安全自动驾驶中的有效性。源代码见 \href{ https://github.com/zlr20/saferl_kit}{this https URL}。
引用
@article{arxiv.2206.08528,
title = {SafeRL-Kit: Evaluating Efficient Reinforcement Learning Methods for Safe Autonomous Driving},
author = {Linrui Zhang and Qin Zhang and Li Shen and Bo Yuan and Xueqian Wang},
journal= {arXiv preprint arXiv:2206.08528},
year = {2022}
}
备注
The 1st Workshop on Safe Learning for Autonomous Driving (SL4AD) with ICML 2022