中文

用近似策略迭代求解公共收益博弈

人工智能 2021-01-13 v1 机器学习

摘要

对于人工智能学习系统要在真实世界环境中广泛应用,能够去中心化运行十分重要。不幸的是,去中心化控制十分困难——即便计算一个ε最优联合策略也是NEXP完全问题。尽管如此,一个近期被重新发现的洞见——一组智能体可通过公共知识进行协调——已催生出能够在小型公共收益博弈中找到最优联合策略的算法。贝叶斯动作解码器(BAD)利用该洞见与深度强化学习,扩展到如双人Hanabi般大的博弈。然而,它所用的近似使其即使在可暴力求解最优解的小型博弈中也无法发现最优联合策略。本工作提出CAPI,一种新颖算法,其如同BAD一样结合公共知识与深度强化学习。但不同于BAD,CAPI优先考量发现最优联合策略的倾向而非可扩展性。尽管这一选择使CAPI无法扩展到如Hanabi般大的博弈,实证结果表明,在CAPI可扩展的博弈上,即使其他现代多智能体强化学习算法无法做到,它也能发现最优联合策略。代码见 https://github.com/ssokota/capi 。

关键词

引用

@article{arxiv.2101.04237,
  title  = {Solving Common-Payoff Games with Approximate Policy Iteration},
  author = {Samuel Sokota and Edward Lockhart and Finbarr Timbers and Elnaz Davoodi and Ryan D'Orazio and Neil Burch and Martin Schmid and Michael Bowling and Marc Lanctot},
  journal= {arXiv preprint arXiv:2101.04237},
  year   = {2021}
}

备注

AAAI 2021