中文

基于模型的强化学习中离策略与在策略训练的结合

机器学习 2021-04-29 v2 人工智能

摘要

深度学习和蒙特卡洛树搜索(MCTS)的结合已被证明在棋盘游戏和视频游戏等多个领域有效。AlphaGo 在我们学习复杂棋盘游戏的能力上代表了重大进步,并迅速带来了 AlphaGo Zero 和 AlphaZero 等显著进展。最近,MuZero 证明了可以通过直接学习环境模型来掌握 Atari 游戏和棋盘游戏,该模型随后与 MCTS 一起用于决定在每个局面下走哪一步。在树搜索期间,算法通过探索若干可能的走法来模拟游戏,然后选择对应最有希望轨迹的动作。在训练时,这些模拟游戏的使用很有限,因为它们的轨迹都没有被直接用作训练样本。即使我们认为并非所有模拟游戏的轨迹都有用,仍有数千条潜在有用的轨迹被丢弃。利用这些轨迹中的信息将提供更多训练数据、更快速,从而带来更快收敛和更高样本效率。近期的工作为 AlphaZero 引入了使用模拟游戏数据的离策略价值目标。在本工作中,我们提出了一种在 MuZero 中利用模拟游戏数据获得离策略目标的方法。我们以多种方式将这些离策略目标与 MuZero 中已在使用的在策略目标结合,并研究了这些目标及其组合在三个具有不同特征的环境中的影响。当以正确的方式组合使用时,我们的结果表明这些目标可以加速训练过程,并比 MuZero 所获得的结果实现更快收敛和更高奖励。

关键词

引用

@article{arxiv.2102.12194,
  title  = {Combining Off and On-Policy Training in Model-Based Reinforcement Learning},
  author = {Alexandre Borges and Arlindo Oliveira},
  journal= {arXiv preprint arXiv:2102.12194},
  year   = {2021}
}