超越硬压缩与软压缩:面向局部与全局信息保留的混合上下文压缩
计算与语言
2025-05-22 v1 机器学习
摘要
大型语言模型 (LLM) 在长序列推理中面临计算效率低下和冗余处理等重大挑战,推动了上下文压缩技术的兴趣。现有方法常依赖token重要性进行硬式局部压缩,或编码上下文以实现软式全局压缩。然而,文本内容相关性分布不均且用户指令需求多样,这些方法常导致有价值信息的丢失。为此,我们提出HyCo₂(Hybrid Context Compression)方法,用于LLM,集成全局与局部视角以指导上下文压缩,同时保留完成任务所需的关键语义与细节。具体而言,我们采用混合适配器基于全局视角细化全局语义,基于不同适配器在不同任务上的优势进行选择。随后,我们引入分类层基于局部视角为每个上下文token分配保留概率,决定其保留或丢弃。为促进全局与局部压缩的平衡集成,我们在指令调优前引入辅助的 paraphrasing 与 completion 预训练。这促进了以指令相关信息为重点的协同集成,同时保留关键局部细节,最终在上下文压缩中实现局部与全局信息的平衡保留。实验表明,我们的HyCo₂方法显著提升了长文本推理能力,同时降低了token使用量。在七个知识密集型问答基准测试中,平均提升13.1%。此外,HyCo₂在减少88.8% token消耗的同时,匹配未压缩方法的性能。
引用
@article{arxiv.2505.15774,
title = {Beyond Hard and Soft: Hybrid Context Compression for Balancing Local and Global Information Retention},
author = {Huanxuan Liao and Wen Hu and Yao Xu and Shizhu He and Jun Zhao and Kang Liu},
journal= {arXiv preprint arXiv:2505.15774},
year = {2025}
}