LongLLMLingua:通过提示压缩加速并增强长上下文场景下的大语言模型
计算与语言
2024-08-13 v2 机器学习
摘要
在长上下文场景中,大语言模型(LLMs)面临三个主要挑战:更高的计算成本、性能下降与位置偏差。研究表明,LLM 性能取决于输入提示中关键信息密度与位置。受这些发现启发,我们提出 LongLLMLingua 用于提示压缩,以提升 LLM 对关键信息的感知,从而同时应对上述三个挑战。我们在多种长上下文场景下的广泛评估表明,LongLLMLingua 不仅提升性能,还显著降低成本与延迟。例如,在 NaturalQuestions 基准中,LongLLMLingua 在 GPT-3.5-Turbo 上以约 4 倍更少 token 将性能提升高达 21.4%,带来可观成本节约。其在 LooGLE 基准中实现 94.0% 成本降低。此外,在以 2x-6x 比率压缩约 10k token 的提示时,LongLLMLingua 可将端到端延迟加速 1.4x-2.6x。我们的代码见 https://aka.ms/LongLLMLingua。
引用
@article{arxiv.2310.06839,
title = {LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression},
author = {Huiqiang Jiang and Qianhui Wu and Xufang Luo and Dongsheng Li and Chin-Yew Lin and Yuqing Yang and Lili Qiu},
journal= {arXiv preprint arXiv:2310.06839},
year = {2024}
}
备注
Accepted at ACL 2024