受限MDP中通用参数化策略的最后迭代收敛性
机器学习
2026-05-04 v2 人工智能
摘要
本文聚焦通过通用参数化策略学习受限马尔可夫决策过程(CMDP)。我们提出一种基于原始-对偶的正则化加速自然策略梯度(PDR-ANPG)算法,利用熵正则项和二次正则项实现目标。对于具有迁移兼容性近似误差的参数化策略类,,PDR-ANPG实现最后迭代最优性间隙和约束违反,样本复杂度为。若该类不完整(),则样本复杂度简化为,当时成立。此外,对于完整策略且的情形,我们的算法实现最后迭代最优性间隙和约束违反,样本复杂度为。这显著改进了通用参数化CMDP的当前最佳最后迭代保证。
引用
@article{arxiv.2408.11513,
title = {Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs},
author = {Washim Uddin Mondal and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2408.11513},
year = {2026}
}
备注
Published in Transactions on Machine Learning Research (TMLR)