生成对抗树搜索的意外负面结果
机器学习
2019-09-06 v4 人工智能
机器学习
摘要
尽管深度强化学习(RL)的许多近期进展依赖于无模型方法,但基于模型的方法因其利用无监督数据学习环境模型的潜力而仍具吸引力。在这项工作中,我们对RL环境的深度生成模型设计进行了广泛研究,并提出了一种样本高效且鲁棒的方法来学习Atari环境模型。我们部署该模型并提出生成对抗树搜索(GATS),这是一种深度RL算法,学习环境模型并在所学模型上实现蒙特卡洛树搜索(MCTS)进行规划。虽然在所学模型上的MCTS计算开销大,类似于AlphaGo,GATS采用深度受限MCTS。GATS使用深度Q网络(DQN)并学习Q函数以对MCTS中的树叶子赋值。我们从理论上分析了GATS的偏差-方差权衡,并表明GATS能够缓解Q估计中的最坏情况误差。虽然我们预期GATS具有更好的样本复杂度和更快收敛到更优策略,但令人惊讶的是,GATS未能超越DQN。我们提供了一项研究,展示了深度受限MCTS为何未能取得理想表现。
引用
@article{arxiv.1806.05780,
title = {Surprising Negative Results for Generative Adversarial Tree Search},
author = {Kamyar Azizzadenesheli and Brandon Yang and Weitang Liu and Zachary C Lipton and Animashree Anandkumar},
journal= {arXiv preprint arXiv:1806.05780},
year = {2019}
}