中文

Hanabi中深度强化学习的心理理论

人工智能 2021-01-26 v1

摘要

部分可观测纸牌游戏Hanabi因其对隐式通信惯例的依赖性以及高效对局显然需要的心理理论(theory of mind)推理,近期被提议作为新的AI挑战问题。本工作中,我们提出一种机制,赋予强化学习(Reinforcement Learning)智能体以心理理论,从而在Hanabi中发现高效合作策略。本工作的主要贡献有三:第一,对Hanabi中计算手牌概率的计算易处理机制的形式化定义。第二,对常规深度强化学习的扩展,引入对有限嵌套心理理论信念层级的推理。最后,由心理理论启用的内在奖励机制,激励智能体与队友共享策略相关私有知识。我们针对最先进强化学习智能体Rainbow展示了算法的效用。

关键词

引用

@article{arxiv.2101.09328,
  title  = {Theory of Mind for Deep Reinforcement Learning in Hanabi},
  author = {Andrew Fuchs and Michael Walton and Theresa Chadwick and Doug Lange},
  journal= {arXiv preprint arXiv:2101.09328},
  year   = {2021}
}