LLMLingua:压缩提示以加速大语言模型推理
计算与语言
2023-12-07 v2 机器学习
摘要
大语言模型(LLMs)因其惊人的能力已被应用于各种应用中。随着思维链(CoT)提示和上下文学习(ICL)等技术的进步,输入 LLM 的提示变得越来越长,甚至超过数万 token。为了加速模型推理并降低成本,本文提出 LLMLingua,一种从粗到细的提示压缩方法,其包含一个预算控制器以在高压缩比下保持语义完整性、一个 token 级迭代压缩算法以更好地建模压缩内容之间的相互依赖,以及一种基于指令微调的语言模型间分布对齐方法。我们在来自不同场景的四个数据集(即 GSM8K、BBH、ShareGPT 和 Arxiv-March23)上进行了实验与分析,表明所提方法取得了最先进的性能,并支持高达 20 倍压缩且性能损失很小。我们的代码可在 https://aka.ms/LLMLingua 获取。
引用
@article{arxiv.2310.05736,
title = {LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models},
author = {Huiqiang Jiang and Qianhui Wu and Chin-Yew Lin and Yuqing Yang and Lili Qiu},
journal= {arXiv preprint arXiv:2310.05736},
year = {2023}
}
备注
Accepted at EMNLP 2023