用于改进ATARI游戏中蒙特卡洛树搜索的深度学习奖励设计
人工智能
2016-04-26 v1
摘要
蒙特卡洛树搜索(MCTS)方法已在诸如围棋和视频游戏等序列决策问题的规划中被证明强大,但当规划深度和采样轨迹受限或当奖励稀疏时,其性能可能很差。我们提出PGRD(用于奖励设计的策略梯度)的一种适配,以学习奖励奖金函数从而改进UCT(一种MCTS算法)。与先前PGRD应用将奖励奖金函数空间限制为手工编码状态-动作特征的线性函数不同,我们将PGRD与多层卷积神经网络结合,从原始感知自动学习特征,并调整非线性奖励奖金函数参数。我们还采用一种减方差梯度方法来改善PGRD的性能。相较于无奖励奖金的UCT,新方法有在多个ATARI游戏上改进了UCT的性能。以这种方式结合PGRD与深度学习,应使为MCTS算法调整奖励比以前远更广泛且实用地适用。
引用
@article{arxiv.1604.07095,
title = {Deep Learning for Reward Design to Improve Monte Carlo Tree Search in ATARI Games},
author = {Xiaoxiao Guo and Satinder Singh and Richard Lewis and Honglak Lee},
journal= {arXiv preprint arXiv:1604.07095},
year = {2016}
}
备注
In 25th International Joint Conference on Artificial Intelligence (IJCAI), 2016