MARL-GPT:多智能体强化学习基座模型
人工智能
2026-04-08 v1
摘要
近期在多智能体强化学习 (MARL) 中取得的进展在诸多具有挑战性的领域和环境中展现出成功,但通常需要为每个任务定制模型。在本工作中,我们提出了一种一致的方法,使单个基于 GPT 的模型能够在多样化的 MARL 环境和任务中学习并表现良好,包括 StarCraft Multi-Agent Challenge、Google Research Football 和 POGEMA。我们的 method MARL-GPT 对专家轨迹进行离线强化学习训练(SMACv2 为 4 亿,GRF 为 1 亿,POGEMA 为 10 亿),并采用无需任务特定调参的单一 transformer-based 观察编码器。实验表明,MARL-GPT 在所有测试环境中均达到与专用基准相当的性能。因此,我们的发现表明,的确有可能构建一个能够处理广泛(且显著不同)多智能体问题的多任务 transformer-based 模型,为基础 MARL 模型(类似 ChatGPT、Llama、Mistral 等在自然语言建模中的角色)铺平了道路。
引用
@article{arxiv.2604.05943,
title = {MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning},
author = {Maria Nesterova and Mikhail Kolosov and Anton Andreychuk and Egor Cherepanov and Oleg Bulichev and Alexey Kovalev and Konstantin Yakovlev and Aleksandr Panov and Alexey Skrynnik},
journal= {arXiv preprint arXiv:2604.05943},
year = {2026}
}
备注
Accepted at AAMAS 2026 (AAAI Track)