中文

在无模型约束强化学习中学习零约束违反策略

机器学习 2021-11-29 v1 人工智能 机器人学 系统与控制 系统与控制

摘要

在强化学习(RL)的试错机制中,当我们期望学习一个安全策略时,会出现一个众所周知的矛盾:如何在缺乏足够数据和关于危险区域的先验模型的情况下学习一个安全策略?现有方法大多对危险动作使用后验惩罚,这意味着智能体在经历危险之前不会受到惩罚。这一事实导致智能体即使在收敛后也无法学习到零违反策略。否则,它将不会受到任何惩罚,并失去关于危险的知识。在本文中,我们提出了安全集演员-评论家(SSAC)算法,该算法使用面向安全的能量函数或安全指数来约束策略更新。安全指数被设计为对潜在危险动作迅速增加,这使我们能够在动作空间上定位安全集,即控制安全集。因此,我们可以在采取危险动作之前识别它们,并进一步在收敛后获得零约束违反策略。我们声称,我们可以以类似于学习价值函数的无模型方式学习能量函数。通过使用能量函数转移作为约束目标,我们制定了一个约束RL问题。我们证明,基于拉格朗日的解决方案确保学习到的策略在某些假设下将收敛到约束最优。所提出的算法在复杂的仿真环境和包含来自自动驾驶汽车的真实控制器的硬件在环(HIL)实验中进行了评估。实验结果表明,在所有环境中收敛的策略都实现了零约束违反,并且性能与基于模型的基线相当。

关键词

引用

@article{arxiv.2111.12953,
  title  = {Learn Zero-Constraint-Violation Policy in Model-Free Constrained Reinforcement Learning},
  author = {Haitong Ma and Changliu Liu and Shengbo Eben Li and Sifa Zheng and Wenchao Sun and Jianyu Chen},
  journal= {arXiv preprint arXiv:2111.12953},
  year   = {2021}
}