中文

Saute RL:基于状态增强的几乎必然安全强化学习

机器学习 2022-06-23 v3 人工智能

摘要

几乎必然(或以概率一)满足安全约束对于强化学习(RL)在现实应用中的部署可能至关重要。例如,飞机降落和起飞理想情况下应以概率一发生。我们通过引入安全增强(Saute)马尔可夫决策过程(MDP)来解决该问题,其中通过将安全约束增强到状态空间并重塑目标函数来消除这些约束。我们证明 Saute MDP 满足贝尔曼方程,并使我们在解决约束几乎必然满足的安全 RL(Safe RL)方面更近一步。我们认为 Saute MDP 允许从不同的视角看待 Safe RL 问题,从而实现新的特性。例如,我们的方法具有即插即用的性质,即任何 RL 算法都可以被“Sauteed”。此外,状态增强允许策略跨安全约束进行泛化。我们最后表明,在约束满足高度重要时,Saute RL 算法可以优于其最先进的对应算法。

关键词

引用

@article{arxiv.2202.06558,
  title  = {Saute RL: Almost Surely Safe Reinforcement Learning Using State Augmentation},
  author = {Aivar Sootla and Alexander I. Cowen-Rivers and Taher Jafferjee and Ziyan Wang and David Mguni and Jun Wang and Haitham Bou-Ammar},
  journal= {arXiv preprint arXiv:2202.06558},
  year   = {2022}
}

备注

ICML 2022