500xCompressor:面向大语言模型的通用提示压缩方法
计算与语言
2024-08-07 v1
摘要
提示压缩对于提升推理速度、降低成本和改善用户体验至关重要。然而,当前方法面临压缩比率低且在评估过程中可能发生数据泄露等挑战。为此,我们提出了500xCompressor——一种将大量自然语言上下文压缩为单个特殊标记的最小化方法。500xCompressor引入约0.3%的额外参数,压缩比范围为6倍至480倍。其设计旨在压缩任意文本,回答各种类型问题,可由原始大语言模型(LLM)无需微调即可直接使用。500xCompressor首先在Arxiv语料库上进行预训练,随后在ArxivQA数据集上进行微调,并在严格未见的经典问答(QA)数据集上进行评估。结果表明,LLM在使用非压缩提示时,保留了62.26%-72.89%的能力。本研究还表明,压缩后的标记并非所有都被等效利用,K V值在高压缩比下保留信息方面具有显著优势。即使针对细粒度复杂信息,自然语言提示的高度压缩性质,仍指向未来应用及进一步研究开发新型LLM语言的前景。
引用
@article{arxiv.2408.03094,
title = {500xCompressor: Generalized Prompt Compression for Large Language Models},
author = {Zongqian Li and Yixuan Su and Nigel Collier},
journal= {arXiv preprint arXiv:2408.03094},
year = {2024}
}