基于转移与基于状态的奖励函数在含风险价值目标的马尔可夫决策过程中的比较
人工智能
2018-12-03 v4
摘要
在强化学习中,基于当前状态和动作的奖励函数被广泛使用。当目标仅涉及(折现)总奖励的期望时,这种方法效果良好。然而,如果目标涉及总奖励分布,结果将出现偏差。本文研究具有两种奖励函数(两者具有相同期望)的短期和长期马尔可夫决策过程(MDP)中的风险价值(Value-at-Risk, VaR)问题。首先,我们证明在 VaR 目标下,当真实奖励函数是基于转移的(关于动作以及当前和下一状态)时,简化的(基于状态的,仅关于动作和当前状态)奖励函数会改变 VaR。其次,对于长期 MDP,我们借助谱理论和中心极限定理来估计 VaR 函数。第三,由于该估计方法适用于仅具有当前状态奖励函数的马尔可夫奖励过程,我们提出了一种针对具有当前和下一状态奖励函数的马尔可夫奖励过程的变换算法,以便在总奖励分布完整的前提下估计 VaR 函数。
引用
@article{arxiv.1612.02088,
title = {Transition-based versus State-based Reward Functions for MDPs with Value-at-Risk},
author = {Shuai Ma and Jia Yuan Yu},
journal= {arXiv preprint arXiv:1612.02088},
year = {2018}
}
备注
55th Annual Allerton Conference on Communication, Control, and Computing (Allerton)