中文

SHARP:通过共享相邻层与恢复参数加速语言模型推理

机器学习 2025-02-13 v1 人工智能

摘要

尽管大语言模型(LLM)推动了自然语言处理任务的发展,但其不断增长的计算与内存需求使得在手机等资源受限设备上的部署日益具有挑战性。本文提出 SHARP(SHaring Adjacent Layers with Recovery Parameters,共享相邻层与恢复参数),一种通过在相邻层间共享参数来加速 LLM 推理的新方法,从而降低内存负载开销,同时引入低秩恢复参数以维持性能。受连续层具有相似输出这一观察的启发,SHARP 采用两阶段恢复过程:单层预热(Single Layer Warmup, SLW)和监督微调(Supervised Fine-Tuning, SFT)。SLW 阶段使用 L2L_2 损失对齐共享层的输出,为随后的 SFT 阶段提供良好的初始化,以进一步恢复模型性能。大量实验表明,SHARP 在各种分布内任务上使用不超过 50k 微调数据即可恢复模型的困惑度,同时将存储的 MLP 参数数量减少 38% 至 65%。我们还对 SHARP 进行了多项消融研究,结果表明,替换模型较后部分的层能带来更好的性能保留,并且在参数量匹配时,不同的恢复参数化表现相似。此外,在移动设备上,与原始 Llama2-7b 模型相比,SHARP 节省了 42.8% 的模型存储,并将总推理时间减少了 42.2%。我们的结果突显了 SHARP 是一种高效的解决方案,无需预训练规模的资源即可降低部署 LLM 的推理成本。

关键词

引用

@article{arxiv.2502.07832,
  title  = {SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters},
  author = {Yiping Wang and Hanxian Huang and Yifang Chen and Jishen Zhao and Simon Shaolei Du and Yuandong Tian},
  journal= {arXiv preprint arXiv:2502.07832},
  year   = {2025}
}

备注

24 pages