中文

多智能体强化学习的离屏修正

机器学习 2024-04-04 v3 人工智能 多智能体系统

摘要

多智能体强化学习(MARL)为涉及多个交互智能体的问题提供了一个框架。尽管与单智能体情形表面相似,多智能体问题通常在训练上更难且在理论上更难分析。在本工作中,我们提出 MA-Trace,一种新的同策略 actor-critic 算法,它将 V-Trace 扩展到 MARL 设定。我们算法的关键优势是在多工作节点设定下的高可扩展性。为此,MA-Trace 利用重要性采样作为离屏修正方法,这使得计算可以分布式进行且不影响训练质量。此外,我们的算法有理论依据——我们证明了一个保证收敛的不动点定理。我们在 StarCraft Multi-Agent Challenge(多智能体算法的标准基准)上广泛评估了该算法。MA-Trace 在其所有任务上都取得了高性能,并在其中某些任务上超越了最先进(SOTA)的结果。

关键词

引用

@article{arxiv.2111.11229,
  title  = {Off-Policy Correction For Multi-Agent Reinforcement Learning},
  author = {Michał Zawalski and Błażej Osiński and Henryk Michalewski and Piotr Miłoś},
  journal= {arXiv preprint arXiv:2111.11229},
  year   = {2024}
}