当更少的潜在变量导致更好的中继:保持信息的潜在多智能体 LLM 协作压缩
机器学习
2026-04-16 v1
摘要
大语言模型(LLM) 基于多智能体系统中的通信正朝着超越离散 token 的方向发展,以保留更丰富的上下文。recent work such as LatentMAS 使智能体能够通过完整 key-value(KV) 缓存交换潜在消息。然而,完整 KV relay 造成高内存和通信成本。我们改造了此设置中的驱逐式 KV 压缩,并引入正交填充(Orthogonal Backfill, OBF)来缓解硬驱逐导致的信息损失。OBF 将被驱逐 KV 状态中低秩正交残差注入到保留 KV 状态中。我们在覆盖数学推理、编码和知识密集型问答等九个标准基准测试上的 proposed method 与完整 KV relay 进行评估。它在保持性能相当的同时,将通信成本降低 79.8%--89.4%。OBF 还提高了性能并在 7 个中的 9 个基准测试中取得最佳结果。这表明,更多信息并不一定导致更好的通信;保留最有用的信息更为重要。我们的 codebase 在 https://github.com/markli404/When-Less-Latent-Leads-to-Better-Relay 上公开。
引用
@article{arxiv.2604.13349,
title = {When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration},
author = {Yiping Li and Zhiyu An and Wan Du},
journal= {arXiv preprint arXiv:2604.13349},
year = {2026}
}