中文

ROSARL:仅奖励的安全强化学习

机器学习 2023-06-02 v1

摘要

强化学习中的一个重要问题是设计能够在环境中安全学习解决任务的智能体。一种常见的解决方案是由人类专家在奖励函数中定义惩罚,或定义在到达不安全状态时需最小化的代价。然而这并非易事,因为过小的惩罚可能导致智能体到达不安全状态,而过大的惩罚会增加收敛时间。此外,设计奖励或代价函数的难度会随着问题复杂度的增加而上升。因此,对于给定的具有给定不安全状态集合的环境,我们致力于寻找不安全状态奖励的上界,使其最优策略最小化到达这些不安全状态的概率,而与任务奖励无关。我们将这一精确上界称为“Minmax惩罚”,并表明它可通过考虑环境的可控性与直径来获得。我们提供了一种简单的实用无模型算法,使智能体在学习任务策略的同时学习该Minmax惩罚,并证明使用它可令智能体在高维连续控制环境中学习到安全策略。

关键词

引用

@article{arxiv.2306.00035,
  title  = {ROSARL: Reward-Only Safe Reinforcement Learning},
  author = {Geraud Nangue Tasse and Tamlin Love and Mark Nemecek and Steven James and Benjamin Rosman},
  journal= {arXiv preprint arXiv:2306.00035},
  year   = {2023}
}