LRAgent:面向多 LoRA LLM 代理的高效 KV 缓存共享方案
机器学习
2026-02-03 v1
摘要
在多 LLM 代理系统中,角色专化通常通过多 LoRA 实现:代理之间共享预训练的底层模型,仅通过轻量级适配器 differ。尽管共享基础模型权重,每个代理仍会独立构建并存储相同的长时程工具增强轨迹的 KV 缓存,这导致显著的内存和计算开销。现有 KV 缓存共享方法在多 LoRA 设置下几乎不予考虑。我们观察到,在不同代理之间,缓存差异主要由适配器输出决定,而来自共享预训练底层模型的激活值高度相似。基于此,我们提出 LRAgent,一种面向多 LoRA 代理的 KV 缓存共享框架,该框架将缓存分解为来自预训练权重的共享基组件与来自 LoRA 权重的适配器依赖组件。LRAgent 通过共享基组件减少内存开销,并以固有的低秩形式存储适配器组件,从而降低计算开销;在共享- 多 LoRA 架构下,进一步共享低秩缓存,避免对已被其他代理处理的上下文进行冗余计算。为高效在运行时重构适配器贡献,我们引入 Flash-LoRA-Attention,一种重新排序注意力计算的 kernel,以避免将低秩缓存 materialize 为完整维度。LRAgent 在代理问答基准测试中实现了接近完全共享缓存的吞吐量和首次 token 延迟,同时保持了接近非共享缓存基准的准确率。
引用
@article{arxiv.2602.01053,
title = {LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents},
author = {Hyesung Jeon and Hyeongju Ha and Jae-Joon Kim},
journal= {arXiv preprint arXiv:2602.01053},
year = {2026}
}
备注
23 pages, 9 figures, 19 tables