中文

Attn-GS:基于注意力引导的高效个性化LLM上下文压缩

计算与语言 2026-02-10 v1

摘要

为个体用户定制大型语言模型(LLM)需要 incorporating 大量交互历史和个人资料,但由于输入token限制,这在高推理延迟和API成本下难以实现。现有方法依赖于启发式方法,如选择最近的交互或调用提示压缩模型来压缩用户个人资料。然而,这些方法将上下文视为一个整体,未考虑LLM内部如何处理和优先级排序不同的个人资料组件。我们研究LLM的注意力模式是否能有效识别重要的个人化信号以实现智能上下文压缩。通过代表性个人化任务的初步研究,我们发现:(a)LLM的注意力模式天然揭示重要信号;(b)微调可增强LLM区分相关与不相关信息的能力。基于这些洞察,我们提出Attn-GS,一个注意力引导的上下文压缩框架,利用来自标记模型的注意力反馈标记重要的个人化句子,然后指导压缩模型生成与任务相关的高质量压缩后的用户上下文。广泛的实验表明,Attn-GS在不同任务、token限制和设置下均显著优于各种基线方法,在使用50倍的token数的情况下实现接近完整上下文的性能。

关键词

引用

@article{arxiv.2602.07778,
  title  = {Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs},
  author = {Shenglai Zeng and Tianqi Zheng and Chuan Tian and Dante Everaert and Yau-Shian Wang and Yupin Huang and Michael J. Morais and Rohit Patki and Jinjin Tian and Xinnan Dai and Kai Guo and Monica Xiao Cheng and Hui Liu},
  journal= {arXiv preprint arXiv:2602.07778},
  year   = {2026}
}