中文

用于深度多智能体强化学习的简化动作解码器

人工智能 2021-05-13 v2

摘要

近年来,我们在多项 AI 基准问题上看到快速进展,现代方法在围棋、扑克和 Dota 中达到了接近或超越人类的表现。这些挑战的一个共同点是它们被设计为对抗性的,或严格来说为零和。与这些设定相反,现实世界中的成功通常要求人类与他人协作和沟通,于至少部分合作的设定中。去年,纸牌游戏 Hanabi 被确立为填补此空白的 AI 新基准环境。特别地,Hanabi 对人类而言有趣之处在于其完全聚焦于心智理论,即观察他者动作时对其意图、信念与视点的有效推理能力。在被他人观察时学会提供信息对强化学习(RL)而言是一项有趣挑战:根本上,RL 要求智能体探索以发现优良策略。然而,若朴素地进行,此随机性将固有地使其在训练中的动作对他人而言信息量更少。我们提出一种新的深度多智能体 RL 方法——简化动作解码器(SAD),其利用集中训练阶段解决此矛盾。训练中 SAD 允许其他智能体不仅观察所选(探索性)动作,而是同时观察队友的贪婪动作。通过将此简单直觉与多智能体学习最佳实践结合,SAD 在 Hanabi 挑战自对弈部分的 2–5 人学习中确立了新方法 SOTA。我们的消融实验显示了 SAD 相较于最佳实践组件的贡献。所有代码与训练好的智能体见 https://github.com/facebookresearch/Hanabi_SAD。

关键词

引用

@article{arxiv.1912.02288,
  title  = {Simplified Action Decoder for Deep Multi-Agent Reinforcement Learning},
  author = {Hengyuan Hu and Jakob N Foerster},
  journal= {arXiv preprint arXiv:1912.02288},
  year   = {2021}
}