针对鲁棒约束平均成本MDP的 primal-only演员评论算法
机器学习
2025-11-11 v1
摘要
在本工作中,我们研究了在鲁棒约束平均成本马尔可夫决策过程 (RCMDPs) 中寻找鲁棒安全策略的问题。一个关键挑战在于由于缺乏强对偶性,使得直接使用标准原分量-对偶方法 for受限RL不可能。额外的困难来自平均成本情景,其中鲁棒Bellman算子在任何范数下都不是压缩映射。为了应对这些挑战,我们提出了一种用于平均成本RCMDPs的演员-评论家算法。我们表明,该方法实现了 -可行性和 -最优性,我们建立了分别在无和有松弛性假设下的样本复杂度为 和 ,这与折扣情景相当。
引用
@article{arxiv.2511.05758,
title = {Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs},
author = {Anirudh Satheesh and Sooraj Sathish and Swetha Ganesh and Keenan Powell and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2511.05758},
year = {2025}
}