中文

约束强化学习中策略梯度的全局末次迭代收敛性

机器学习 2024-11-13 v2

摘要

约束强化学习(CRL)处理的是智能体需要在满足特定领域约束(通常表述为期望成本)的同时,通过最大化期望回报来实现目标的序贯决策问题。在此设定下,基于策略的方法被广泛使用,因为它们在处理连续控制问题时具有若干优势。这些方法在策略空间中搜索,采用基于动作或基于参数的探索策略,具体取决于它们是直接学习随机策略的参数还是随机超策略的参数。在本文中,我们提出了一个通过基于梯度的原始-对偶算法解决CRL问题的通用框架,该框架依赖于交替上升/下降方案并带有对偶变量正则化。我们引入了一种与探索方式无关的算法,称为C-PG,该算法在(弱)梯度支配假设下具有全局末次迭代收敛保证,改进并推广了现有结果。随后,我们设计了C-PGAE和C-PGPE,分别是C-PG的基于动作和基于参数的版本,并展示了它们如何自然地扩展到以成本风险度量形式定义的约束,这在安全关键场景中通常是必需的。最后,我们在约束控制问题上对我们的算法进行了数值验证,并与最先进的基线方法进行了比较,证明了其有效性。

关键词

引用

@article{arxiv.2407.10775,
  title  = {Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning},
  author = {Alessandro Montenegro and Marco Mussi and Matteo Papini and Alberto Maria Metelli},
  journal= {arXiv preprint arXiv:2407.10775},
  year   = {2024}
}

备注

Accepted NeurIPS 2024