风险对待的总奖励强化学习
机器学习
2025-10-27 v2
摘要
风险对待的总奖励马尔可夫决策过程 (MDP) 提供了一个用于建模和解决无折扣无限期目标的有前景的框架。现有的基于模型的方法对于像熵风险度量 (ERM) 和熵价值风险 (EVaR) 这样的风险度量,在小规模问题中效果良好,但需要对转移概率拥有完整访问权限。我们提出了一种 Q 学习算法,用于计算总奖励 ERM 和 EVaR 目标的最优定态策略。该算法及其最优性得益于 ERM 的动态一致性和可寻因性。我们的数值结果在表格域中表明,所提出的 Q 学习算法能够快速可靠地收敛到最优的风险对待价值函数。
引用
@article{arxiv.2506.21683,
title = {Risk-Averse Total-Reward Reinforcement Learning},
author = {Xihong Su and Jia Lin Hau and Gersi Doko and Kishan Panaganti and Marek Petrik},
journal= {arXiv preprint arXiv:2506.21683},
year = {2025}
}
备注
The paper has been accepted by the Thirty-Ninth Annual Conference on Neural Information Processing Systems(NeurIPS 2025)