中文

离策略学习中的自适应权衡

机器学习 2020-07-31 v2 机器学习

摘要

文献中存在种类繁多的离策略学习算法,并且该领域持续取得新的突破,不断提升理论理解并催生出最先进的强化学习算法。在本文中,我们对这一算法空间采取统一的视角,并考量它们在三个基本量上的权衡:更新方差、不动点偏差和收缩速率。这为现有方法带来了新的视角,同时也自然地衍生出用于离策略评估与控制的新算法。我们开发了一种这样的算法,名为 C-trace,证明它能够比现有常用方法更有效地进行这些权衡,并且能够扩展以在大规模环境中实现最先进的性能。

关键词

引用

@article{arxiv.1910.07478,
  title  = {Adaptive Trade-Offs in Off-Policy Learning},
  author = {Mark Rowland and Will Dabney and Rémi Munos},
  journal= {arXiv preprint arXiv:1910.07478},
  year   = {2020}
}

备注

AISTATS 2020 camera-ready version