中文

Graph-SND:基于稀疏聚合的行为多样性多智能体强化学习

机器学习 2026-05-07 v1 多智能体系统

摘要

系统神经多样性(SND)通过对所有 (n2)\binom{n}{2} 对智能体之间的距离进行平均来衡量多智能体强化学习中的行为异构性,使得每次调用呈二次时间复杂度。我们引入 Graph-SND,将完全图平均替换为任意图 GG 上边缘的加权平均。存在三个场景:G=KnG=K_n 时恢复 SND;固定稀疏 GG 定义局部多样性测度,计算复杂度为 O(E)O(|E|);随机抽样边数则得到无偏 Horvitz-Thompson 估计器和标准化样本均值,样本边数 mm 的浓度为 O(1/m)O(1/\sqrt{m})。对于固定稀疏图,我们证明了扩散器的前向指数失真界以及在低秩距离结构下的谱细化;对于随机 dd 常规图,我们证明了无条件概率下 O~(Dmax/n)\widetilde{\mathcal{O}}(D_{\max}/\sqrt{n}) 的界。我们在 VMAS 上验证了恢复、无偏性、浓度以及墙钟时间扩展,PettingZoo TVD 面板检查非高斯传递。在 500 次迭代 n=100n=100 的 PPO 运行中,Bernoulli-0.10.1 Graph-SND 跟踪完整 SND,同时将每次调用指标时间约降低 1010 倍,冻结策略 GPU 计时至 n=500n=500 遵循预测的 (n2)/E\binom{n}{2}/|E| 加速。随机 dd 常规扩散器在 Θ(nlogn)\Theta(n \log n) 边数下实现 SNDGu/SND[0.9987,1.0013]\mathrm{SND}_{G}^{\mathrm{u}}/\mathrm{SND} \in [0.9987, 1.0013]。在 n=50n=50 的 DiCo 多样性控制中,Bernoulli-0.10.1 Graph-SND 保持集合点跟踪,九个匹配单元的配对奖励差异与零不可区分,同时将每次调用指标成本降低约 9.59.5 倍。这些结果表明,SND 聚合瓶颈可在不改变度量语义的前提下被消除,yielding 一个即插即用的稀疏替代方案,扩展了完全图 SND 的规模,并支持被动测量和闭环多样性控制。

关键词

引用

@article{arxiv.2605.05020,
  title  = {Graph-SND: Sparse Aggregation for Behavioral Diversity in Multi-Agent Reinforcement Learning},
  author = {Shawn Ray},
  journal= {arXiv preprint arXiv:2605.05020},
  year   = {2026}
}

备注

22 pages, 12 figures, 7 tables