通过查询引导的激活回填提升长上下文管理
计算与语言
2025-05-26 v3 人工智能
信息检索
摘要
处理长上下文对大型语言模型(LLM)构成了重大挑战,这源于其固有的上下文窗口限制以及大量键值(KV)激活带来的计算负担,严重影响了效率。对于信息寻求任务,完整的上下文感知通常是不必要的,因为查询的信息需求可以根据其复杂度在局部细节到全局视角之间动态变化。然而,现有方法难以有效适应这些动态的信息需求。在本文中,我们提出了一种通过查询引导的激活回填(ACRE)来处理长上下文信息寻求任务的方法。ACRE 为长上下文构建了双层 KV Cache,其中第一层(L1)缓存紧凑地捕获全局信息,而第二层(L2)缓存提供详细的局部信息。ACRE 在两个缓存之间建立代理关系,允许输入查询关注 L1 缓存,并用 L2 缓存中的相关条目动态回填它。该机制将全局理解与特定于查询的局部细节相结合,从而改善了答案解码。在多个长上下文信息寻求数据集上的实验证明了 ACRE 的有效性,在性能和效率上均取得了提升。
引用
@article{arxiv.2412.12486,
title = {Boosting Long-Context Management via Query-Guided Activation Refilling},
author = {Hongjin Qian and Zheng Liu and Peitian Zhang and Zhicheng Dou and Defu Lian},
journal= {arXiv preprint arXiv:2412.12486},
year = {2025}
}
备注
ACL25 Main Conference