中文

基于课程学习的强化学习改进方法

机器学习 2019-06-11 v2 机器学习

摘要

人类在以结构化方式呈现示例时,往往能更快地学习复杂的抽象概念。例如,在学习如何玩棋盘游戏时,通常首先学到的概念之一是游戏如何结束,即导致终止状态(胜、负或平)的动作。先学习残局的优势在于,一旦理解了导致终止状态的动作,就有可能逐步学习距离终止状态更远的动作的后果——我们称之为残局优先课程。目前通用棋盘游戏最先进的机器学习玩家,Google DeepMind 的 AlphaZero,并未采用结构化训练课程,而是始终从整局游戏中进行学习。通过将残局优先训练课程应用于训练受 AlphaZero 启发的玩家,我们凭经验表明,与使用无训练课程的玩家相比,人工玩家在训练早期阶段的学习速度可以得到提升。

关键词

引用

@article{arxiv.1903.12328,
  title  = {Improved Reinforcement Learning with Curriculum},
  author = {Joseph West and Frederic Maire and Cameron Browne and Simon Denman},
  journal= {arXiv preprint arXiv:1903.12328},
  year   = {2019}
}

备注

Draft prior to submission to IEEE Trans on Games. Changed paper slightly