中文

基于风险价值准则的马尔可夫决策过程

最优化与控制 2025-07-31 v1

摘要

风险价值(VaR),亦称分位数,是金融等领域的关键风险度量。然而,在马尔可夫决策过程(MDP)中优化VaR指标具有挑战性,因为VaR非可加,且传统动态规划方法无法适用。本文对离散时间有限MDP中的VaR优化进行了系统性研究。我们考虑两类关键情境下的VaR:无限视角下累积奖励的稳态VaR,以及有限视角下累积奖励的VaR。通过建立VaR最大化MDP与一系列概率最小化MDP之间的等价性,我们将VaR最大化MDP转化为约束双层优化问题。内层是最小化MDP奖励低于目标λ\lambda的概率的政策优化,而外层是代表目标VaR的单参数λ\lambda优化。对于稳态情境,概率最小化MDP可通过标准MDP的期望准则解决;相反,对于有限视角情况,可通过增广状态MDP求解。我们证明了确定性平稳政策对稳态VaR MDP的最优性,以及确定性历史依赖政策对有限视角VaR MDP的最优性。我们推导了政策改进规则和最优政策的必要充分条件。此外,我们发展了用于最大化MDP中VaR的政策迭代类算法,并证明了其收敛性。我们的研究结果也扩展至VaR最小化MDP,需作适当修改后方可应用。最后,我们进行数值实验,展示了该方法的计算效率和实际适用性。我们的研究为通过分位数与概率之间的对偶关系,探索MDP中分位数相关指标的优化,开辟了新道路。

关键词

引用

@article{arxiv.2507.22355,
  title  = {Markov Decision Processes with Value-at-Risk Criterion},
  author = {Li Xia and Jinyan Pan},
  journal= {arXiv preprint arXiv:2507.22355},
  year   = {2025}
}

备注

49 pages, 10 figures, an optimization method for solving MDP with quantile or VaR metrics