通过集变换器进行关系推理:可证明的效率及其在 MARL 中的应用
机器学习
2022-10-18 v3 多智能体系统
机器学习
摘要
具有置换不变智能体框架的协作式多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)在现实应用中取得了巨大的经验成功。遗憾的是,由于多智能体诅咒以及现有工作对关系推理探索有限,对该 MARL 问题的理论理解尚显不足。在本文中,我们验证了变换器实现了复杂的关系推理,并提出并分析了使用变换器近似器的无模型与基于模型的离线 MARL 算法。我们证明了无模型和基于模型算法的次优性间隙分别独立于智能体数量和对数依赖于智能体数量,从而缓解了多智能体诅咒。这些结果源于变换器新颖的泛化误差界以及使用变换器对系统动力学的最大似然估计(Maximum Likelihood Estimate, MLE)的新颖分析。我们的基于模型的算法是首个可证明高效的、显式利用智能体置换不变性的 MARL 算法。我们改进的泛化界可能具有独立意义,并适用于超出 MARL 的与变换器相关的其他回归问题。
引用
@article{arxiv.2209.09845,
title = {Relational Reasoning via Set Transformers: Provable Efficiency and Applications to MARL},
author = {Fengzhuo Zhang and Boyi Liu and Kaixin Wang and Vincent Y. F. Tan and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2209.09845},
year = {2022}
}