中文

用于约束马尔可夫决策过程最终迭代收敛的增广拉格朗日方法

机器学习 2026-05-13 v1

摘要

我们研究了无限时域、折扣约束马尔可夫决策过程(CMDPs)的策略优化。虽然现有的理论保证通常适用于混合策略,但部署这样的策略在计算和内存上是密集的。这导致了一个实际的不匹配,即必须部署一个单一的(最终迭代)策略。因此,近期的理论工作集中于证明最终迭代收敛,但大多局限于表格设置或实践中很少使用的算法变体。为了解决这个问题,我们使用约束优化中经典的非精确增广拉格朗日(AL)方法,并提出了一个对CMDPs具有可证明的最终迭代收敛性的通用框架。我们首先关注表格设置,并提出用投影Q上升法(PQA)来解决AL子问题。结合PQA的理论保证和标准的AL分析,使我们能够建立全局最终迭代收敛性。我们将这些结果推广到处理对数线性策略,并证明PQA的一种高效的投影变体可以实现与先前工作相当的最终迭代收敛保证。最后,我们证明了我们的框架可以扩展到复杂的非线性策略,并在连续控制任务上对其进行了评估。

关键词

引用

@article{arxiv.2605.11694,
  title  = {Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs},
  author = {Michael Lu and Max Qiushi Lin and Mo Chen and Sharan Vaswani},
  journal= {arXiv preprint arXiv:2605.11694},
  year   = {2026}
}