基于梯度下降引导的可扩展合作多智能体学习
量子物理
2026-02-24 v1 强关联电子
摘要
合作多智能体强化学习(MARL)的可扩展性基本受到跨智能体噪声的限制。当智能体共享共同奖励时,每个智能体的学习信号是 computed 从共享回报,该回报取决于所有智能体,因此其他智能体的随机性以跨智能体噪声形式进入信号,且随着 的增大而增大。幸运的是,许多工程系统(如云计算和电力系统)具有可微的解析模型,可高效地指示系统状态,为超出噪声共享回报的新参考提供了可能。在本工作中,我们提出了梯度下降引导策略梯度(DG-PG),该框架通过来自可微解析模型的无噪声下降信号来增强策略梯度更新。我们证明了 DG-PG 将策略梯度估计器的方差从 降低到 ,保持了合作博弈的均衡,并实现了智能体无关的样本复杂度 。在最多包含 1500 个智能体的异构云资源调度任务上,DG-PG 在平均 20 个 episode 内收敛,而 MAPPO 和 IPPO 在相同架构下无法收敛。
引用
@article{arxiv.2602.20077,
title = {Entanglement formation in two-dimensional materials within microcavity},
author = {Fabricio Danel Matias and Facundo Arreyes and Juan Sebastián Ardenghi},
journal= {arXiv preprint arXiv:2602.20077},
year = {2026}
}
备注
10 pages