中文

结合Q学习与带摊销价值估计的搜索

机器学习 2020-01-13 v2 机器学习

摘要

我们提出“带摊销价值估计的搜索”(SAVE),一种将无模型Q学习与基于模型的蒙特卡洛树搜索(MCTS)相结合的方法。在SAVE中,学习到的状态-动作价值先验用于引导MCTS,后者估计一组改进的状态-动作价值。新的Q估计随后与真实经验结合用于更新先验。这有效地摊销了MCTS执行的价值计算,导致无模型学习与基于模型的搜索之间的协作关系。SAVE可构建于任何可访问模型的Q学习智能体之上,我们通过将其整合进执行具挑战性物理推理任务和Atari的智能体来演示这一点。SAVE以更少的训练步数持续获得更高奖励,并且——与典型基于模型的搜索方法相反——在极小搜索预算下也产生强劲性能。通过结合真实经验与搜索期间计算的信息,SAVE证明有可能同时改善无模型学习的性能与规划的计算成本。

关键词

引用

@article{arxiv.1912.02807,
  title  = {Combining Q-Learning and Search with Amortized Value Estimates},
  author = {Jessica B. Hamrick and Victor Bapst and Alvaro Sanchez-Gonzalez and Tobias Pfaff and Theophane Weber and Lars Buesing and Peter W. Battaglia},
  journal= {arXiv preprint arXiv:1912.02807},
  year   = {2020}
}

备注

Published as a conference paper at ICLR 2020