中文

学习弱通信平均奖励约束马尔可夫决策过程:强对偶性与改进的遗憾界

机器学习 2026-05-13 v1 最优化与控制

摘要

我们研究了弱通信假设下的无限时域平均奖励约束马尔可夫决策过程(CMDPs)。我们的贡献有两方面。首先,我们为具有有限状态和动作空间的平稳策略下的弱通信平均奖励 CMDP 建立了强对偶性。尽管在弱通信设定下缺乏线性规划形式并由此导致非凸性,我们通过仔细利用占有测度集的几何结构,证明了强对偶性仍然成立。其次,基于这一结果,我们提出了一种原始-对偶截断值迭代算法,用于学习弱通信平均奖励线性 CMDP。我们的算法实现了 O~(T2/3)\widetilde{\mathcal{O}}(T^{2/3}) 的遗憾和约束违反界,改进了已知的最佳界,其中 TT 表示交互次数。我们的方法将截断值迭代扩展到约束设定,并将其适配到有限时域近似,这稳定了对偶变量,对于实现改进的遗憾界至关重要。为了分析这一点,我们开发了一种基于强对偶性的新方法,该方法能够将复合拉格朗日遗憾分解为对遗憾和约束违反的单独界。

关键词

引用

@article{arxiv.2605.11586,
  title  = {Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret},
  author = {Kihyun Yu and Beomhan Baek and Dabeen Lee},
  journal= {arXiv preprint arXiv:2605.11586},
  year   = {2026}
}