马尔可夫决策过程长期奖励CVaR的最大化
最优化与控制
2023-12-05 v1 系统与控制
系统与控制
摘要
本文从风险寻求视角研究马尔可夫决策过程(MDPs)的优化,其中风险由条件风险价值(CVaR)度量。目标是找到一种策略,在所有依赖历史的随机策略中,最大化无限时域上瞬时奖励的长期CVaR。通过建立两个相反方向的最优性不等式,我们证明了在依赖历史的随机策略集合上MDPs的长期CVaR最大值可以在平稳随机策略类中找到。与经典MDPs相反,我们发现可能不存在用于最大化CVaR的最优平稳确定性策略。相反,我们证明了最优平稳随机策略的存在性,该策略最多需在两个动作上随机化。通过CVaR的凸优化表示,我们将长期CVaR最大化MDP转换为一个极小极大问题,其中我们证明了最小值和最大值的可交换性以及相关鞍点解的存在性。此外,我们提出一种通过求解两个线性规划来找到鞍点解的算法。这些结果随后被扩展到同时涉及最大化奖励的均值与CVaR某种组合的目标。最后,我们进行数值实验以展示主要结果。
引用
@article{arxiv.2312.01586,
title = {On the Maximization of Long-Run Reward CVaR for Markov Decision Processes},
author = {Li Xia and Zhihui Yu and Peter W. Glynn},
journal= {arXiv preprint arXiv:2312.01586},
year = {2023}
}
备注
Risk-seeking optimization of CVaR in MDP