基于反馈的树搜索用于强化学习
人工智能
2018-05-16 v1 机器学习
最优化与控制
摘要
受蒙特卡洛树搜索(MCTS)在若干人工智能(AI)应用领域近期成功的启发,我们提出了一种基于模型的强化学习(RL)技术,该技术迭代地在原始无限时域马尔可夫决策过程的一批小型有限时域版本上应用 MCTS。有限时域问题的终止条件,即由 MCTS 生成的决策树的叶节点评估器,由估计的值函数与估计的策略函数组合指定。MCTS 过程生成的建议随后作为反馈提供,以便通过分类与回归来精炼下一次迭代的叶节点评估器。我们给出了首个基于树搜索的 RL 算法的样本复杂度界。此外,我们展示了该技术的深度神经网络实现能够为流行的多人在线战术竞技(MOBA)游戏王者荣耀创建一个有竞争力的 AI 智能体。
引用
@article{arxiv.1805.05935,
title = {Feedback-Based Tree Search for Reinforcement Learning},
author = {Daniel R. Jiang and Emmanuel Ekwedike and Han Liu},
journal= {arXiv preprint arXiv:1805.05935},
year = {2018}
}
备注
19 pages, to be presented at ICML 2018