中文

基于翻转的机会约束马尔可夫决策过程策略

机器学习 2024-10-10 v1 最优化与控制

摘要

安全强化学习 (RL) 是许多实际决策问题中确保安全性的关键需求的有前景的方法。在安全 RL 研究中,虽然期望累积安全约束 (ECSC) 通常是首选,但机会约束在不确定性下更实用。本文提出了一种用于机会约束马尔可夫决策过程 (CCMDP) 的“翻转策略”。翻转策略通过掷动作候选者之间的可能失真硬币来选择下一个动作。翻转概率和两个动作候选者会根据状态而变化。我们建立了 CCMDP 的贝尔曼方程,并进一步证明了在最优解集合中存在翻转策略。由于以联合机会约束形式求解问题在实际中具有挑战性,我们随后证明了联合机会约束可近似为期望累积安全约束 (ECSC),并证明了在采用 ECSC 的受限 MDP 最优解集合中也存在翻转策略。作为具体的实用实现示例,我们呈现了一个将受限策略优化适用于训练翻转策略的框架。该框架可应用于其他安全 RL 算法。我们展示了在 Safety Gym 基准测试中,翻转策略可在相同的安全约束限制下提升现有安全 RL 方法的性能。

关键词

引用

@article{arxiv.2410.06474,
  title  = {Flipping-based Policy for Chance-Constrained Markov Decision Processes},
  author = {Xun Shen and Shuo Jiang and Akifumi Wachi and Kaumune Hashimoto and Sebastien Gros},
  journal= {arXiv preprint arXiv:2410.06474},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024