中文

安全强化学习中的策略分岔

机器学习 2024-03-29 v3

摘要

安全强化学习(RL)为约束最优控制问题提供了先进的解决方案。现有的安全 RL 研究隐含地假设策略函数具有连续性,即策略以平滑、不间断的方式将状态映射到动作;然而,我们的研究发现,在某些场景下,可行的策略应当是不连续的或多值的,在不连续的局部最优之间进行插值不可避免地会导致约束违规。我们首次识别了这种现象的产生机制,并采用拓扑分析严格证明了安全 RL 中策略分岔的存在,这对应于可达元组的可缩性。我们的定理揭示了在无障碍状态空间非单连通的场景下,可行策略必须是分岔的,这意味着其输出动作需要随着状态的变化而发生突变。为了训练这种分岔策略,我们提出了一种名为多模态策略优化(MUPO)的安全 RL 算法,该算法利用高斯混合分布作为策略输出。通过选择具有最高混合系数的高斯分量可以实现分岔行为。此外,MUPO 还集成了谱归一化和前向 KL 散度,以增强策略探索不同模式的能力。车辆控制任务的实验表明,我们的算法成功学习了分岔策略并确保了令人满意的安全性,而连续策略则不可避免地遭遇约束违规。

关键词

引用

@article{arxiv.2403.12847,
  title  = {Policy Bifurcation in Safe Reinforcement Learning},
  author = {Wenjun Zou and Yao Lyu and Jie Li and Yujie Yang and Shengbo Eben Li and Jingliang Duan and Xianyuan Zhan and Jingjing Liu and Yaqin Zhang and Keqiang Li},
  journal= {arXiv preprint arXiv:2403.12847},
  year   = {2024}
}