中文

乐观以保守:快速学习 CVaR 策略

机器学习 2020-04-06 v2 人工智能

摘要

尽管在大多数强化学习方法中最大化期望回报是目标,但诸如条件风险价值(CVaR)等风险敏感目标更适合许多高风险应用。然而,关于如何探索以快速学习具有良好 CVaR 的策略,人们所知相对较少。在本文中,我们提出了基于面对不确定性乐观原则的样本高效学习马尔可夫决策过程中 CVaR 最优策略的首个算法。该方法依赖于分布贝尔曼算子的一种新颖乐观版本,该算子将概率质量从回报分布的下尾移至上尾。我们证明了该算子在表格策略评估情形下的渐近收敛性与乐观性。我们进一步证明,在多个具有离散与连续状态空间的模拟环境中,我们的算法比现有基线大幅更快地找到 CVaR 最优策略。

关键词

引用

@article{arxiv.1911.01546,
  title  = {Being Optimistic to Be Conservative: Quickly Learning a CVaR Policy},
  author = {Ramtin Keramati and Christoph Dann and Alex Tamkin and Emma Brunskill},
  journal= {arXiv preprint arXiv:1911.01546},
  year   = {2020}
}