中文

先压缩,再提示:利用可迁移提示改善LLM推理的精度-效率权衡

计算与语言 2023-10-11 v2 机器学习

摘要

尽管大语言模型(LLMs)中庞大的参数数量造就了其卓越性能,但如此大的规模也使其低效且耗费内存。因此,它们难以部署在商品硬件(如单块GPU)上。鉴于此类设备的显存与功耗限制,模型压缩方法被广泛用于减小模型规模与推理延迟,这本质上以模型质量换取效率提升。因而,优化此精度-效率权衡对LLM在商品硬件上的部署至关重要。本文中,我们引入一种通过提示压缩模型来优化该权衡的新视角。具体而言,我们首先观察到:对某些问题,经精心设计的硬提示可显著提升压缩LLM的生成质量,尽管并非所有问题皆然。基于此观察,我们提出一种软提示学习方法,将压缩模型暴露于提示学习过程中,旨在增强提示性能。实验分析表明,我们的软提示策略大幅提升了8倍压缩的LLaMA-7B模型(采用4位量化与50%权重剪枝联合压缩)的性能,使其在流行基准上匹敌未压缩对应模型。此外,我们证明这些所学提示可跨数据集、任务和压缩程度迁移。借此可迁移性,我们可将软提示接入新压缩模型,以“原位”方式提升测试时精度。

关键词

引用

@article{arxiv.2305.11186,
  title  = {Compress, Then Prompt: Improving Accuracy-Efficiency Trade-off of LLM Inference with Transferable Prompt},
  author = {Zhaozhuo Xu and Zirui Liu and Beidi Chen and Yuxin Tang and Jue Wang and Kaixiong Zhou and Xia Hu and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:2305.11186},
  year   = {2023}
}