Hanabi中深度强化学习的心理理论
人工智能
2021-01-26 v1
摘要
部分可观测纸牌游戏Hanabi因其对隐式通信惯例的依赖性以及高效对局显然需要的心理理论(theory of mind)推理,近期被提议作为新的AI挑战问题。本工作中,我们提出一种机制,赋予强化学习(Reinforcement Learning)智能体以心理理论,从而在Hanabi中发现高效合作策略。本工作的主要贡献有三:第一,对Hanabi中计算手牌概率的计算易处理机制的形式化定义。第二,对常规深度强化学习的扩展,引入对有限嵌套心理理论信念层级的推理。最后,由心理理论启用的内在奖励机制,激励智能体与队友共享策略相关私有知识。我们针对最先进强化学习智能体Rainbow展示了算法的效用。
引用
@article{arxiv.2101.09328,
title = {Theory of Mind for Deep Reinforcement Learning in Hanabi},
author = {Andrew Fuchs and Michael Walton and Theresa Chadwick and Doug Lange},
journal= {arXiv preprint arXiv:2101.09328},
year = {2021}
}