中文

带百分位数风险准则的风险约束强化学习

人工智能 2017-04-07 v3 机器学习 最优化与控制

摘要

在许多序贯决策问题中,人们希望在考虑\emph{风险}(即提高对小概率高后果事件的警觉)的同时最小化期望累积代价。因此,本文的目标是提出用于风险约束马尔可夫决策过程(MDPs)的高效强化学习算法,其中风险通过机会约束或累积代价的条件风险价值(CVaR)约束来表示。我们将此类问题统称为百分位数风险约束MDPs。具体而言,我们首先推导了用于计算百分位数风险约束MDPs的拉格朗日函数梯度的公式。然后,我们设计了策略梯度和行动者-评论家算法,其(1)估计该梯度,(2)沿下降方向更新策略,(3)沿上升方向更新拉格朗日乘子。对于这些算法,我们证明了其收敛到局部最优策略。最后,我们在最优停止问题和在线营销应用中展示了我们算法的有效性。

关键词

引用

@article{arxiv.1512.01629,
  title  = {Risk-Constrained Reinforcement Learning with Percentile Risk Criteria},
  author = {Yinlam Chow and Mohammad Ghavamzadeh and Lucas Janson and Marco Pavone},
  journal= {arXiv preprint arXiv:1512.01629},
  year   = {2017}
}

备注

arXiv admin note: substantial text overlap with arXiv:1406.3339