射线干扰:深度强化学习中平台期的来源
机器学习
2019-04-26 v1 人工智能
机器学习
摘要
本文不提出新方法,而是研究现有学习算法中存在的问题。我们研究强化学习(RL)的学习动态,具体而言是一种由学习与控制未来数据分布之间的耦合引起的特征,这种耦合之所以出现是因为 RL 智能体控制其未来的数据分布。在函数逼近存在的情况下,这种耦合可能导致一种有问题的“射线干扰”,其特征是学习动态依次穿越若干性能平台期,有效地将智能体限制为一次只学习一件事,即使在并行学习更优时也是如此。我们确立了射线干扰发生的条件,展示了它与鞍点的关系,并在受限设定下获得了精确的学习动态。我们刻画了它的若干性质并讨论了可能的补救措施。
引用
@article{arxiv.1904.11455,
title = {Ray Interference: a Source of Plateaus in Deep Reinforcement Learning},
author = {Tom Schaul and Diana Borsa and Joseph Modayil and Razvan Pascanu},
journal= {arXiv preprint arXiv:1904.11455},
year = {2019}
}
备注
Full version of RLDM abstract