面向安全强化学习的安全编辑器策略
机器学习
2022-10-12 v3 人工智能
机器人学
摘要
我们考虑安全强化学习(RL)问题,即在极低约束违反率下最大化效用。假设给定任务时对环境安全模型无先验知识或预训练,智能体须通过探索学习哪些状态与动作是安全的。该研究方向中一种流行方法是将无模型RL算法与拉格朗日方法结合,以动态调整约束奖励相对于效用奖励的权重。它依赖单一策略处理效用与约束奖励间的冲突,这通常颇具挑战。我们提出SEditor,一种双策略方法,学习一个安全编辑器策略,将效用最大化策略提出的潜在不安全动作转换为安全动作。安全编辑器经训练以最大化约束奖励,同时最小化动作编辑前后效用状态-动作值的铰链损失。SEditor将现有假设简化安全模型的安全层设计,扩展至安全模型在理论上可任意复杂的通用安全RL场景。作为一阶方法,它易于实现且推理与训练均高效。在12个Safety Gym任务与2个安全竞速任务上,SEditor相较基线获得高得多的整体安全加权效用(SWU)分数,并展现出卓越的效用表现,约束违反率低至每2k时间步一次,即便在障碍物密集环境中亦然。在某些任务上,该低违反率比具有相似效用表现的无约束RL方法低至多200倍。代码见 https://github.com/hnyu/seditor。
引用
@article{arxiv.2201.12427,
title = {Towards Safe Reinforcement Learning with a Safety Editor Policy},
author = {Haonan Yu and Wei Xu and Haichao Zhang},
journal= {arXiv preprint arXiv:2201.12427},
year = {2022}
}
备注
NeurIPS 2022 camera-ready version