中文

用于零样本协调的等变网络

机器学习 2024-04-11 v2

摘要

在Dec-POMDP中成功的协调要求智能体为其同伴采用鲁棒策略与可解释的博弈风格。一种常见失败模式是对称性破缺,即智能体任意地收敛于许多等价但互不相容的策略之一。这些例子通常包括部分可观测性,例如挥动右手与左手来传递隐蔽信息。本文提出一种用于Dec-POMDP的新型等变网络架构,其有效利用环境对称性以改善零样本协调,且比先前方法更为有效。我们的方法亦作为通用预训练策略的“协调改进算子”,因而可在测试时与任意自博弈算法结合使用。我们提供了工作的理论保证,并在Hanabi这一AI基准任务上测试,表明我们的方法在零样本协调上优于其他对称性感知基线,且能够提升多种预训练策略的协调能力。特别地,我们展示了我们的方法可用于改进Hanabi基准上零样本协调的最优水平。

关键词

引用

@article{arxiv.2210.12124,
  title  = {Equivariant Networks for Zero-Shot Coordination},
  author = {Darius Muglich and Christian Schroeder de Witt and Elise van der Pol and Shimon Whiteson and Jakob Foerster},
  journal= {arXiv preprint arXiv:2210.12124},
  year   = {2024}
}