中文

当多智能体系统中 KV Cache 复用失败时:候选间交互对 LLM 评判者至关重要

多智能体系统 2026-01-14 v1 计算与语言

摘要

多智能体 LLM 系统通常生成多个候选响应,并由 LLM 评判者进行聚合。为了降低此类流程中占主导地位的预填充成本,最近的工作提倡在部分共享的上下文中复用 KV cache,并报告了生成智能体的显著加速。在这项工作中,我们表明这些效率提升并不能均匀地转移到以评判者为中心的推理上。在 GSM8K、MMLU 和 HumanEval 上,我们发现对执行智能体有效的复用策略可能会严重干扰评判者行为:最终任务的准确率可能看起来稳定,但评判者的选择在密集预填充下变得高度不一致。我们使用评判者一致性率(JCR)量化了这一风险,并提供了诊断表明复用系统性地削弱了跨候选注意力,尤其是对于较晚的候选块。我们的消融进一步证明,显式的跨候选交互对于保留密集预填充决策至关重要。总体而言,我们的结果识别了 KV cache 复用一个先前被忽视的失败模式,并强调以评判者为中心的推理是一个独特的机制,需要专门的、具备风险感知的系统设计。

关键词

引用

@article{arxiv.2601.08343,
  title  = {When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges},
  author = {Sichu Liang and Zhenglin Wang and Jiajia Chu and Pengfei Xia and Hui Zang and Deyu Zhou},
  journal= {arXiv preprint arXiv:2601.08343},
  year   = {2026}
}