中文

风险敏感强化学习中的状态增广变换

人工智能 2018-12-03 v2

摘要

在MDP框架下,尽管一般奖励函数取三个变量——当前状态、动作和后续状态;但它常被简化为两个变量的函数——当前状态和动作。前者称为基于转移的奖励函数,后者称为基于状态的奖励函数。当目标仅涉及期望累积奖励时,这种简化完美适用。然而,当目标为风险敏感时,该简化会导致不正确的价值。我们提出状态增广变换(SATs),其在风险敏感强化学习中保持奖励序列、奖励分布以及最优策略不变。在风险敏感情形下,首先我们证明,对于任意具有随机基于转移的奖励函数的MDP,存在一个具有确定性基于状态的奖励函数的MDP,使得对第一个MDP的任意给定(随机化)策略,存在第二个MDP的相应策略,使得两个马尔可夫奖励过程共享相同的奖励序列。其次我们说明在库存控制问题中两种情况需要所提出的SATs:一种可能是在具有基于转移的奖励函数的MDP上使用Q-learning(或其他学习方法),另一种可能是在具有一般奖励函数的马尔可夫过程上使用针对具有确定性基于状态的奖励函数的马尔可夫过程的方法。我们以风险价值(VaR)为例说明SATs的优势,VaR是奖励分布上的风险度量,而非分布的均值和方差等度量。我们说明了直接使用Q-learning在奖励分布估计中的误差,并展示了SATs如何使方差公式适用于具有一般奖励函数的马尔可夫过程。

关键词

引用

@article{arxiv.1804.05950,
  title  = {State-Augmentation Transformations for Risk-Sensitive Reinforcement Learning},
  author = {Shuai Ma and Jia Yuan Yu},
  journal= {arXiv preprint arXiv:1804.05950},
  year   = {2018}
}