基于 ERM 和 EVaR 的风险规避总报酬 MDP
机器学习
2025-07-15 v2 人工智能
摘要
在折扣 MDP 中优化风险规避目标具有挑战性,因为大多数模型不存在直接的动态规划方程,并且需要复杂的历史依赖策略。在本文中,我们证明了在熵风险度量 (ERM) 和熵风险价值 (EVaR) 风险度量下的风险规避总报酬准则可以通过平稳策略进行优化,使其易于分析、解释和部署。我们提出了指数值迭代、策略迭代和线性规划来计算最优策略。与先前的工作相比,我们的结果仅需要暂态 MDP 这一相对温和的条件,并允许正负报酬。我们的结果表明,在广泛的风险规避强化学习领域中,总报酬准则可能比折扣准则更可取。
引用
@article{arxiv.2408.17286,
title = {Risk-averse Total-reward MDPs with ERM and EVaR},
author = {Xihong Su and Julien Grand-Clément and Marek Petrik},
journal= {arXiv preprint arXiv:2408.17286},
year = {2025}
}