通过去中心化学习实现异构视觉智能体之间的涌现通信
计算机视觉与模式识别
2026-05-13 v1 人工智能
摘要
符号是共享的,但感知是私有的。我们通过去中心化学习研究异构视觉智能体之间的涌现通信,探讨当智能体具有不同的视觉表征时,哪些视觉信息可以变得可共享。我们的智能体不通过共享的外部通信目标来优化消息,而是只交换离散的令牌序列,并使用局部的感知证据更新自己的模型。这种设置关注涌现通信中一个未被充分探索的方面,即检验在没有共享感知通路的情况下,共同的符号是否能够出现,以及私有视觉空间之间的相似性如何约束所产生语言的内容和对称性。我们在Metropolis-Hastings Captioning Game(MHCG)中实例化了这种设置,在该游戏中,两个智能体通过交换提议的令牌序列来协作形成共享的描述,一个监听者使用基于其自身视觉特征评估的MH风格标准来接受或拒绝这些序列。我们比较了三种冻结视觉编码器的配对,智能体从随机初始化的文本模块开始。在MS-COCO上的实验表明,MHCG产生了视觉信息丰富的共享令牌序列,在跨智能体对齐、视觉特征预测和图像-文本检索方面优于无通信基线;所有跨智能体指标都随着编码器不匹配程度的增加而下降。中等的编码器异质性减少了共享序列的数量,同时保持了每个序列的视觉特异性,而更强的编码器异质性则产生更少、更粗糙且更不对称的序列。消融研究表明,监听端的MH接受对于避免退化的令牌形成至关重要。这些结果表明,共享的符号可以仅从局部的感知评估中产生,而跨编码器的视觉表征相似性塑造了所产生语言的内容和对称性。
引用
@article{arxiv.2605.11695,
title = {Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning},
author = {Mikako Ochiai and Masatoshi Nagano and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2605.11695},
year = {2026}
}