中文

面向通用策略参数化和神经评论家的平均奖励约束MDP的全局收敛性分析

机器学习 2026-03-10 v1

摘要

我们研究具有一般策略参数化和多层神经网络评论家的无限视角约束马尔可夫决策过程(CMDP)。现有的约束强化学习理论分析大多依赖表格策略或线性评论家,这限制了其在高维和连续控制问题上的适用性。我们提出了一种原始-对偶自然演员-评论家算法,将神经评论家估计与自然策略梯度更新相结合,并利用神经切向核(NTK)理论控制函数逼近误差,无需访问混合时间的oracle。我们建立了全局收敛性和累积约束违规率为 O~(T1/4)\tilde{\mathcal{O}}(T^{-1/4}) 的结果,误差由策略和评论家类导致。我们的结果为CMDP提供了首个具有一般策略和多层神经评论家的此类保证,显著扩展了演员-评论家方法在线性评论家范式之外的理论基础。

关键词

引用

@article{arxiv.2603.07698,
  title  = {Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization},
  author = {Anirudh Satheesh and Pankaj Kumar Barman and Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2603.07698},
  year   = {2026}
}

备注

Submitted to UAI 2026