中文

基于 ERM 和 EVaR 的风险规避总报酬 MDP

机器学习 2025-07-15 v2 人工智能

摘要

在折扣 MDP 中优化风险规避目标具有挑战性,因为大多数模型不存在直接的动态规划方程,并且需要复杂的历史依赖策略。在本文中,我们证明了在熵风险度量 (ERM) 和熵风险价值 (EVaR) 风险度量下的风险规避总报酬准则可以通过平稳策略进行优化,使其易于分析、解释和部署。我们提出了指数值迭代、策略迭代和线性规划来计算最优策略。与先前的工作相比,我们的结果仅需要暂态 MDP 这一相对温和的条件,并允许正负报酬。我们的结果表明,在广泛的风险规避强化学习领域中,总报酬准则可能比折扣准则更可取。

关键词

引用

@article{arxiv.2408.17286,
  title  = {Risk-averse Total-reward MDPs with ERM and EVaR},
  author = {Xihong Su and Julien Grand-Clément and Marek Petrik},
  journal= {arXiv preprint arXiv:2408.17286},
  year   = {2025}
}