中文

ACPO:一种面向带约束平均MDP的策略优化算法

机器学习 2024-05-27 v4 人工智能

摘要

面向约束MDP(CMDP)的强化学习(RL)对各种应用而言是日益重要的问题。通常,平均准则比折扣准则更合适。然而,面向平均CMDP(ACMDP)的RL仍是一个具挑战性的问题。为折扣约束RL问题设计的算法往往在平均CMDP设定下表现不佳。在本文中,我们引入了一种新的带函数近似的、面向平均准则约束MDP的策略优化算法。平均约束策略优化(Average-Constrained Policy Optimization, ACPO)算法受基于信赖域的策略优化算法启发。我们发展了平均CMDP的基本灵敏度理论,并将相应界用于算法设计中。我们提供了其性能的理论保证,并通过在各种具挑战性的OpenAI Gym环境中的广泛实验工作,展示了与其他适配于ACMDP的最先进算法相比的优越经验性能。

关键词

引用

@article{arxiv.2302.00808,
  title  = {ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints},
  author = {Akhil Agnihotri and Rahul Jain and Haipeng Luo},
  journal= {arXiv preprint arXiv:2302.00808},
  year   = {2024}
}

备注

To appear in Proceedings of the $\mathit{41}^{st}$ International Conference on Machine Learning (ICML), Vienna, Austria. PMLR 235, 2024