中文

可行行动者-评论者:用于确保状态级安全约束的强化学习

机器学习 2021-06-15 v3

摘要

现有安全强化学习(RL)方法常用安全约束仅定义于初始状态的期望上,却允许某些特定状态不安全,这对现实世界安全关键任务而言尚不充分。本文引入可行行动者-评论者(FAC)算法,这是首个考虑状态级安全(例如每个初始状态的安全性)的无模型约束 RL 方法。我们指出,某些状态无论选择何种策略都固有不安全,而对其他状态则存在确保安全的策略,我们称此类状态与策略为可行的。通过构造可用于 RL 采样的状态级拉格朗日函数,并采用额外神经网络逼近状态级拉格朗日乘子,我们得以获得最优可行策略,其对每个可行状态确保安全,并对不可行状态给出尽可能安全的策略。此外,训练所得的乘子网络可通过状态级互补松弛条件判断给定状态是否可行。我们提供理论保证:FAC 在约束满足与奖励优化方面均优于以往的基于期望的约束 RL 方法。在机器人运动任务与安全探索任务上的实验结果验证了所提方法的安全性提升与可行性解释能力。

关键词

引用

@article{arxiv.2105.10682,
  title  = {Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety},
  author = {Haitong Ma and Yang Guan and Shegnbo Eben Li and Xiangteng Zhang and Sifa Zheng and Jianyu Chen},
  journal= {arXiv preprint arXiv:2105.10682},
  year   = {2021}
}