利用 UCT 树搜索加速 Empowerment 计算
人工智能
2018-03-28 v1 信息论
性能
math.IT
摘要
内在动机模型是在缺乏外在奖励的情况下产生合理行为的重要手段。其在电子游戏中的应用十分广泛,从内在动机的通用游戏智能体到同伴和敌人等非玩家角色均有涉及。信息论意义上的 Empowerment 是一个极具前景的候选动机,能够产生可信、通用且鲁棒的行为。然而,尽管它可以在无需精心设计和学习的外部奖励函数的情况下使用,但其计算成本高昂。在本文中,我们提出了一种改进的 UCT 树搜索方法,以缓解 Empowerment 在离散和确定性场景中的计算复杂性。我们演示了如何利用 UCT 修改 Monte-Carlo 树搜索以实现 Empowerment 最大化,并讨论了有助于更好采样的三项额外修改。我们对该方法进行了定量评估,分析了在计算资源量变化的情况下,我们的方法与穷举 Empowerment 计算基线的接近程度;同时进行了定性评估,分析了在类 Minecraft 场景中产生的行为。
引用
@article{arxiv.1803.09866,
title = {Accelerating Empowerment Computation with UCT Tree Search},
author = {Christoph Salge and Christian Guckelsberger and Rodrigo Canaan and Tobias Mahlmann},
journal= {arXiv preprint arXiv:1803.09866},
year = {2018}
}
备注
8ish pages, 6 figures, data for graphs included in sources