中文

LLMLingua:压缩提示以加速大语言模型推理

计算与语言 2023-12-07 v2 机器学习

摘要

大语言模型(LLMs)因其惊人的能力已被应用于各种应用中。随着思维链(CoT)提示和上下文学习(ICL)等技术的进步,输入 LLM 的提示变得越来越长,甚至超过数万 token。为了加速模型推理并降低成本,本文提出 LLMLingua,一种从粗到细的提示压缩方法,其包含一个预算控制器以在高压缩比下保持语义完整性、一个 token 级迭代压缩算法以更好地建模压缩内容之间的相互依赖,以及一种基于指令微调的语言模型间分布对齐方法。我们在来自不同场景的四个数据集(即 GSM8K、BBH、ShareGPT 和 Arxiv-March23)上进行了实验与分析,表明所提方法取得了最先进的性能,并支持高达 20 倍压缩且性能损失很小。我们的代码可在 https://aka.ms/LLMLingua 获取。

关键词

引用

@article{arxiv.2310.05736,
  title  = {LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models},
  author = {Huiqiang Jiang and Qianhui Wu and Chin-Yew Lin and Yuqing Yang and Lili Qiu},
  journal= {arXiv preprint arXiv:2310.05736},
  year   = {2023}
}

备注

Accepted at EMNLP 2023