视觉虫洞:异构多智能体系统中的潜在空间通信
计算与语言
2026-05-29 v2 计算机视觉与模式识别
机器学习
摘要
由大型语言模型(LLM)驱动的多智能体系统(MAS)已实现了高级的协作推理能力,但仍受制于离散文本通信,带来运行时开销和信息量化损失。虽然潜在状态转移提供了一种替代方案,但现有方法要么假设同质的发送方-接收方架构,要么依赖于特定配对的学习翻译器,限制了跨不同模型家族(具有不相交流形)的可扩展性。我们重新概念化视觉语言模型(VLM)的视觉界面——这些模型为自然图像而训练——作为异构智能体之间连续通信信道,并将其实现为“视觉虫洞”:一种通用视觉编解码器将推理痕迹映射到共享的连续参考空间中,并注入接收方的视觉路径,从而实现无需配对翻译器的跨架构潜在状态转移。该框架采用心形拓扑结构,将对齐复杂度从 降低到 ,并通过无标签的教师-学生蒸馏训练,无需并行隐藏状态监督。广泛的实验在异构 VLM 家族(Qwen-VL、Gemma、SmolVLM2、LFM2.5-VL)和九个推理基准上表明,视觉虫洞在大多数评估设置下均显著降低了端到端 wall-clock 时间,并实现了正面的宏平均 -accuracy 提升。
引用
@article{arxiv.2602.15382,
title = {The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems},
author = {Xiaoze Liu and Ruowang Zhang and Weichen Yu and Siheng Xiong and Liu He and Feijie Wu and Hoin Jung and Matt Fredrikson and Xiaoqian Wang and Jing Gao},
journal= {arXiv preprint arXiv:2602.15382},
year = {2026}
}
备注
Preprint. Work in progress