面向安全关键任务的免模型强化学习评估
机器学习
2022-12-13 v1 机器人学
摘要
在许多涉及自主智能体的现实应用中,安全是首要考量。尽管大量强化学习(RL)方法聚焦于安全关键任务,仍缺乏在复杂未知动态下、于每个决策步骤均遵守安全约束的此类算法的高质量评估。本文从状态级安全 RL 的视角重审该领域已有工作,并将其分别归类为基于投影、基于恢复和基于优化的方法。此外,我们提出展开安全层(USL),一种结合安全优化与安全投影的联合方法。该新技术通过深度展开架构显式强制硬约束,并在权衡奖励提升与约束满足方面具有结构优势。为促进该领域进一步研究,我们在统一流程中复现相关算法,并将其整合进 SafeRL-Kit——一个为安全关键任务提供即用接口与评估工具的工具包。我们随后在从机器人控制到自动驾驶的六个基准上对所涉算法进行比较研究。实证结果揭示了它们在无需依赖任务的手工设计下学习零成本回报策略时的适用性与鲁棒性。项目页面见 https://sites.google.com/view/saferlkit。
引用
@article{arxiv.2212.05727,
title = {Evaluating Model-free Reinforcement Learning toward Safety-critical Tasks},
author = {Linrui Zhang and Qin Zhang and Li Shen and Bo Yuan and Xueqian Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.05727},
year = {2022}
}
备注
37th AAAI Conference on Artificial Intelligence (AAAI-23)