中文

通过搜索改进合作部分可观测博弈中的策略

人工智能 2019-12-06 v1 多智能体系统

摘要

近期在博弈中的超人类结果主要在多种零和设定(如围棋和扑克)中取得,其中智能体需与他人竞争。然而,正如人类,现实世界 AI 系统也必须在合作部分可观测环境中与其他智能体协调与沟通。这些设定通常要求参与者既解释他人行为,又在被解释时以具信息性的方式行动。这些能力通常被概括为心智理论,并被视为社交互动的关键。本文提出两种不同的搜索技术,可应用于改进合作部分可观测博弈中任意约定策略。第一种,单智能体搜索,通过令除一个以外所有智能体按约定策略行动,将问题有效转为单智能体设定。相反,在多智能体搜索中,所有智能体在算力可行时执行相同的公共知识搜索过程,否则回退至按约定策略行动。我们证明这些搜索过程在理论上保证至少维持约定策略的原始性能(直至有界近似误差)。在 Hanabi 基准挑战问题中,我们的搜索技术大幅改进了所测试的每个智能体的性能,当应用于使用 RL 训练的策略时,在游戏中取得 24.61 / 25 的新最优分数,而此前最佳为 24.08 / 25。

关键词

引用

@article{arxiv.1912.02318,
  title  = {Improving Policies via Search in Cooperative Partially Observable Games},
  author = {Adam Lerer and Hengyuan Hu and Jakob Foerster and Noam Brown},
  journal= {arXiv preprint arXiv:1912.02318},
  year   = {2019}
}