中文

受限MDP中通用参数化策略的最后迭代收敛性

机器学习 2026-05-04 v2 人工智能

摘要

本文聚焦通过通用参数化策略学习受限马尔可夫决策过程(CMDP)。我们提出一种基于原始-对偶的正则化加速自然策略梯度(PDR-ANPG)算法,利用熵正则项和二次正则项实现目标。对于具有迁移兼容性近似误差的参数化策略类,ϵbias\epsilon_{\mathrm{bias}},PDR-ANPG实现最后迭代ϵ\epsilon最优性间隙和ϵ\epsilon约束违反,样本复杂度为O~(ϵ2min{ϵ2,ϵbias13})\tilde{\mathcal{O}}(\epsilon^{-2}\min\{\epsilon^{-2},\epsilon_{\mathrm{bias}}^{-\frac{1}{3}}\})。若该类不完整(ϵbias>0\epsilon_{\mathrm{bias}}>0),则样本复杂度简化为O~(ϵ2)\tilde{\mathcal{O}}(\epsilon^{-2}),当ϵ<(ϵbias)16\epsilon<(\epsilon_{\mathrm{bias}})^{\frac{1}{6}}时成立。此外,对于完整策略且ϵbias=0\epsilon_{\mathrm{bias}}=0的情形,我们的算法实现最后迭代ϵ\epsilon最优性间隙和ϵ\epsilon约束违反,样本复杂度为O~(ϵ4)\tilde{\mathcal{O}}(\epsilon^{-4})。这显著改进了通用参数化CMDP的当前最佳最后迭代保证。

关键词

引用

@article{arxiv.2408.11513,
  title  = {Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs},
  author = {Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2408.11513},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research (TMLR)