生成进化元求解器(GEMS):面向可扩展无代理强化学习的无代理 surrogate 方法
机器学习
2026-03-10 v2 人工智能
摘要
可扩展的多代理强化学习(MARL)仍是AI的核心挑战。现有的基于群体的方法,如Policy-Space Response Oracles(PSRO),需要存储显式的策略群体并构建完整的收益矩阵,导致二次计算和线性内存开销。我们提出了Generative Evolutionary Meta-Solver(GEMS),一种无代理的框架,用一组紧凑的潜在锚点和一个 amortized 生成器取代显式群体。与彻底构建收益矩阵不同,GEMS依赖于无偏的蒙特卡罗模拟 rollouts、乘法权重 meta-dynamics以及一种 model-free empirical-Bernstein UCB oracle 来自适应地扩展策略集合。在生成器中训练最佳响应,使用基于优势的 trust-region 目标,消除存储和训练separate actors的需求。我们在各种Two-player和Multi-Player游戏中评估了GEMS,如Deceptive Messages Game、Kuhn Poker和Multi-Particle环境。我们发现GEMS比PSRO快约,内存使用为,同时也获得更高的奖励。这些结果表明,GEMS保留了PSRO的游戏论保证,同时克服了其根本性的效率问题,从而在多个领域实现了可扩展的多代理学习。
引用
@article{arxiv.2509.23462,
title = {Generative Evolutionary Meta-Solver (GEMS): Scalable Surrogate-Free Multi-Agent Reinforcement Learning},
author = {Alakh Sharma and Gaurish Trivedi and Kartikey Singh Bhandari and Yash Sinha and Dhruv Kumar and Pratik Narang and Jagat Sesh Challa},
journal= {arXiv preprint arXiv:2509.23462},
year = {2026}
}
备注
Accepted at Transactions on Machine Learning Research (TMLR)