中文

LoCoCo:用于长上下文压缩的卷积 dropping 技术

机器学习 2024-10-29 v2 计算与语言

摘要

本文通过提出一种新方法——用于长上下文压缩的 dropping in 卷积(LoCoCo),解决大型语言模型(LLM)处理长上下文序列的内存瓶颈问题。LoCoCo仅使用固定大小的键值(KV)缓存,可在推理和微调阶段提高效率。与先前基于启发式方法选择性丢弃 KV 对的先前方法不同,LoCoCo利用数据驱动的自适应融合技术,将先前的 KV 对与新到达的标记融合,以最小化上下文信息的丢失并确保准确的注意力建模。通过注入一维卷积核来实现这种标记集成,这些卷积核会动态计算每个 KV 缓存槽的混合权重。 designed for broad compatibility with existing LLM frameworks,LoCoCo 允许轻松地“即插即用”集成,而无需进行架构修改,同时承担最小的调优开销。实验表明,LoCoCo 在各种上下文长度下始终保持出色的性能,并在推理和微调阶段实现高的上下文压缩率。我们成功地将最多 3482 个标记压缩到 128 大小的 KV 缓存中,同时保持与完整序列相当的性能——在相同缓存大小下,准确率比基线提高最高可达 0.2791。我们还在微调阶段有效地将上下文长度从 4K 扩展到 32K,使用固定大小为 512 的 KV 缓存,实现的性能类似于使用整个序列进行微调。

关键词

引用

@article{arxiv.2406.05317,
  title  = {LoCoCo: Dropping In Convolutions for Long Context Compression},
  author = {Ruisi Cai and Yuandong Tian and Zhangyang Wang and Beidi Chen},
  journal= {arXiv preprint arXiv:2406.05317},
  year   = {2024}
}