UniGist:迈向通用且硬件对齐的序列级长上下文压缩
计算与语言
2025-09-22 v1
摘要
大型语言模型处理长上下文输入的能力日益增强,但键值(KV)缓存的内存开销仍是通用部署的主要瓶颈。尽管已探索了多种压缩策略,但序列级压缩(即丢弃某些 token 的完整 KV 缓存)尤为困难,因为它可能导致重要上下文信息的丢失。为了解决这一问题,我们引入了 UniGist,这是一种序列级长上下文压缩框架,通过以细粒度方式用特殊压缩 token(gists)替换原始 token,从而高效保留上下文信息。我们采用无分块训练策略,并设计了一个带有 gist shift 技巧的高效内核,以实现优化的 GPU 训练。我们的方案还通过允许实际移除已压缩的 token 来支持灵活推理,从而实现实时内存节省。在多个长上下文任务上的实验表明,UniGist 显著提升了压缩质量,在细节召回任务和长程依赖建模中表现尤为出色。
引用
@article{arxiv.2509.15763,
title = {UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression},
author = {Chenlong Deng and Zhisong Zhang and Kelong Mao and Shuaiyi Li and Tianqing Fang and Hongming Zhang and Haitao Mi and Dong Yu and Zhicheng Dou},
journal= {arXiv preprint arXiv:2509.15763},
year = {2025}
}
备注
15 pages, 7 figures