序数蒙特卡洛树搜索
人工智能
2020-12-09 v1
摘要
在许多问题设定中,最显著的是在博弈游戏中,智能体因其动作而获得可能延迟的奖励。通常,这些奖励是手工设计的而非自然给定。即便简单的仅终局奖励,如胜为1负为-1,也不能视为无偏陈述,因为这些值是任意选取的,且学习器的行为可能随不同编码而改变,例如将负的值设为-0.5(实践中常为鼓励学习而如此),这很常见。很难论证好的奖励,且智能体的表现常依赖于奖励信号的设计。特别是在那些状态本质上仅有序数排序、且游戏状态值之间无有意义距离信息的领域中,数值奖励信号必然有偏。本文中,我们考察蒙特卡洛树搜索(MCTS)——一种求解MDP的流行算法,突显其使用奖励的一个反复出现的问题,并表明对奖励的序数处理可克服该问题。利用通用视频游戏博弈框架,我们展示了新提出的序数MCTS算法优于基于偏好的MCTS、原始MCTS及各种其他MCTS变体。
引用
@article{arxiv.1901.04274,
title = {Ordinal Monte Carlo Tree Search},
author = {Tobias Joppen and Johannes Fürnkranz},
journal= {arXiv preprint arXiv:1901.04274},
year = {2020}
}
备注
preview