SACHI: 多智能体强化学习中通过整体信息整合的结构化智能体协调
机器学习
2026-05-20 v2
摘要
基于部分局部观测进行协作的多智能体强化学习智能体面临一个根本性的信息瓶颈:选择联合最优动作所需的知识分散在整个团队中,但每个智能体必须在无法获取其队友观测、意图或所选动作的情况下做出决策。现有方法要么忽略此瓶颈,要么将其压缩为标量混合信号,要么通过学习的通信信道绕过它。将动作协调视为智能体间结构化信息整合的问题,我们提出了\textit{通过整体信息整合的结构化智能体协调}(SACHI),其中,在智能体间协调图上的图Transformer卷积,在动作选择之前,用来自队友的、对接收者敏感且内容相关的信号来丰富每个智能体的表示。我们在五个涵盖空间、通信和对抗性协调挑战的协作任务上,将SACHI与十二个基线进行了评估。SACHI在每个任务上都一致地达到或优于最佳基线,并且严格的聚合统计分析(包括带自助置信区间的归一化指标、Friedman排名和性能分析)证实,这一优势具有统计显著性、跨环境的鲁棒性,并且不能归因于模型容量的增加。参数匹配的消融实验进一步将增益来源追溯到单一架构属性:消息传递算子中内容依赖的程度。
引用
@article{arxiv.2605.08391,
title = {SACHI: Structured Agent Coordination via Holistic Information Integration in Multi-Agent Reinforcement Learning},
author = {Nikunj Gupta and James Zachary Hare and Jesse Milzman and Rajgopal Kannan and Viktor Prasanna},
journal= {arXiv preprint arXiv:2605.08391},
year = {2026}
}