风险敏感强化学习的分布模型等价性
机器学习
2023-12-05 v2 人工智能
摘要
我们考虑风险敏感强化学习中的模型学习问题。我们从理论上证明,恰值等价性——一种可用于在风险中性设定下最优规划的模型学习方法——不足以在风险敏感设定下最优规划。我们利用分布强化学习引入两种新的模型等价性概念:一种具一般性,可用于任意风险度量的规划,但不可处理;以及一种实用变体,允许选择可最优规划的风险度量。我们展示了我们的框架如何用于增强任意无模型风险敏感算法,并给出表格与大规模实验以证明其能力。
引用
@article{arxiv.2307.01708,
title = {Distributional Model Equivalence for Risk-Sensitive Reinforcement Learning},
author = {Tyler Kastner and Murat A. Erdogdu and Amir-massoud Farahmand},
journal= {arXiv preprint arXiv:2307.01708},
year = {2023}
}