中文

马尔可夫决策过程中双重静态 CVaR 分解的基本局限性

机器学习 2026-04-16 v2

摘要

最近的研究表明,在马尔可夫决策过程 (MDP) 中,基于对偶公式寻找静态 CVaR 最优策略的动态规划 (DP) 方法可能会失败,但此失败的根本原因尚不清楚。我们通过将焦点从策略优化转移到看似更简单的策略评估任务上,对这些发现进行了扩展。我们表明,评估给定策略的静态 CVaR 可以被表述为两个不同的最小化问题。我们引入了一组“风险分配一致性约束”,它们的解必须满足这些约束才能匹配,并证明这些约束的交集为空是先前观察到的评估误差的来源。我们将评估误差量化为 CVaR 评估间隙,并证明在对偶 CVaR DP 上进行优化时所观察到的问题,可以通过返回策略具有非零的 CVaR 评估间隙来解释。最后,我们利用所提出的风险分配约束视角,证明在对偶 CVaR 分解上寻找单一的均匀最优策略存在根本上的局限性,并确定了一个 MDP,在该 MDP 中没有任何单一策略能够在所有初始风险水平上均是最优的。

关键词

引用

@article{arxiv.2507.14005,
  title  = {On the Fundamental Limitations of Dual Static CVaR Decompositions in Markov Decision Processes},
  author = {Mathieu Godbout and Audrey Durand},
  journal= {arXiv preprint arXiv:2507.14005},
  year   = {2026}
}