中文

通过 LITE 指令微调启用中间层解码以加速 LLaMA 推理

计算与语言 2023-11-08 v2

摘要

大语言模型(LLMs)在各类自然语言任务中取得了卓越性能;然而,其庞大的规模导致推理缓慢且计算成本高昂。针对此问题,我们提出利用来自中间层的额外显式损失对 LLMs 进行指令微调(LITE),并表明这能使这些中间层获得“良好”的生成能力,且不影响最终层的生成能力。我们在中间层以 token 级别执行“基于动态置信度的提前退出”,在不损害生成质量的前提下提升文本生成效率。我们在 Alpaca 数据集上对 LLaMA-2 模型进行指令微调,并在四个人类指令测试集上进行全面评估。我们表明,动态提前退出实现了持续且可观的推理计算成本改进(7B 模型为 37.86%,13B 模型为 46.35%),同时保持了回复的生成质量。我们进一步从多个重要方面对结果进行深入分析,例如比较输出的语义相似度,以及通过比较输出中生成的 token 数量来剖析效率提升。总之,我们的工作有助于在保持生成质量的同时提升 LLM 推理效率,这是实现其广泛应用的关键一步。

关键词

引用

@article{arxiv.2310.18581,
  title  = {Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE},
  author = {Neeraj Varshney and Agneet Chatterjee and Mihir Parmar and Chitta Baral},
  journal= {arXiv preprint arXiv:2310.18581},
  year   = {2023}
}