KV 缓存压缩,但必须付出什么代价?长上下文能力方法的综合基准
计算与语言
2024-10-10 v2
摘要
长上下文能力是大型语言模型(LLMs)的关键能力,因为它减轻了人类消化长篇文本的困难。这种能力使模型能够应对诸如书籍摘要、代码辅助等众多传统上需要大量人力的任务。然而,基于变换器的 LLMs 面临着 KV 缓存不断增大的挑战以及注意力处理扩展输入的内在复杂性;其中多种以效率为导向的方法——包括 KV 缓存量化、标记删除、提示压缩、线性时间序列模型和混合体系结构——已被提出以产生高效且具长上下文能力的模型。尽管已取得这些进展,但尚无现有工作在合理对齐的环境中全面评估了这些方法。在本工作中,我们填补了这一空白,通过提供当前方法的分类框架并对 10+ 状态方法在七类长上下文任务上的进行评估。我们的工作揭示了大量此前所未知的现象,并提供了洞见——以及友好的工作台——供未来开发更具长上下文能力的 LLMs 使用。源代码可在 https://github.com/henryzhongsc/longctx_bench 获取。
引用
@article{arxiv.2407.01527,
title = {KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approaches},
author = {Jiayi Yuan and Hongyi Liu and Shaochen Zhong and Yu-Neng Chuang and Songchen Li and Guanchu Wang and Duy Le and Hongye Jin and Vipin Chaudhary and Zhaozhuo Xu and Zirui Liu and Xia Hu},
journal= {arXiv preprint arXiv:2407.01527},
year = {2024}
}