随机性有时是协调所必需的
人工智能
2026-05-11 v1 机器人学
摘要
在合作型多智能体强化学习 (MARL) 中,针对同质智能体的完全参数共享是标准做法。然而,在置换对称观测下,共享的确定性策略为每个智能体输出相同的动作分布,使得角色分化变得不可能。理论上,这个失败可以通过在匿名相同处理器中使用对称性破缺来解决,这需要随机性。我们提出了 Diamond Attention,一种交叉注意力架构,其中每个智能体在每个时间步采样一个标量随机数,诱导出瞬态排序,在智能体间的注意力中屏蔽排名较低的同伴,同时使任务注意力完全不被屏蔽。这在单次广播轮次中实现了一种随机比特协调协议,并且基于集合的注意力使得能够零样本部署到不同规模的团队中。我们在三种机制下进行了评估,以隔离结构化随机性何时起作用。在完全对称的 XOR 博弈中,我们的方法达到了 的成功率,而所有确定性基线都停滞在 附近。在控制协调任务中,在 上训练的策略零样本泛化到 。在 SMACLite 跨场景迁移中,我们实现了零样本迁移,而标准基线由于结构限制无法迁移。此外,用标准的基于 dropout 的随机性替换结构化掩码会导致 0\% 的胜率,证实了协议空间结构而非随机噪声才是起作用的关键要素。https://anonymous.4open.science/r/randomness-137A/
引用
@article{arxiv.2605.06825,
title = {Randomness is sometimes necessary for coordination},
author = {Rohan Patil and Jai Malegaonkar and Henrik I. Christensen},
journal= {arXiv preprint arXiv:2605.06825},
year = {2026}
}