中文

KD-LoRA:结合 LoRA 与知识蒸馏的高效微调混合方法

计算与语言 2024-10-29 v1 人工智能 机器学习

摘要

大语言模型(LLM)在各种下游任务中展现出了卓越的性能。然而,LLM 对计算和内存的高要求是一个主要瓶颈。为了解决这一问题,研究者提出了低秩适应(LoRA)等参数高效微调(PEFT)方法,以在确保性能损失最小的同时降低计算成本。此外,知识蒸馏(KD)一直是从教师模型获取紧凑学生模型的流行选择。在本工作中,我们提出了 KD-LoRA,一种将 LoRA 与 KD 相结合的新型微调方法。我们的结果表明,KD-LoRA 实现了与全量微调(FFT)和 LoRA 相当的性能,同时显著降低了资源需求。具体而言,KD-LoRA 在 GLUE 基准上保留了 LoRA 98% 的性能,且模型紧凑度提高了 40%。此外,与 LoRA 相比,KD-LoRA 将 GPU 内存使用量减少了 30%,同时与 FFT 和 LoRA 相比,推理时间减少了 30%。我们在三个仅编码器模型上评估了 KD-LoRA:BERT、RoBERTa 和 DeBERTaV3。代码可在 https://github.com/rambodazimi/KD-LoRA 获取。

关键词

引用

@article{arxiv.2410.20777,
  title  = {KD-LoRA: A Hybrid Approach to Efficient Fine-Tuning with LoRA and Knowledge Distillation},
  author = {Rambod Azimi and Rishav Rishav and Marek Teichmann and Samira Ebrahimi Kahou},
  journal= {arXiv preprint arXiv:2410.20777},
  year   = {2024}
}

备注

Accepted at 4th NeurIPS Efficient Natural Language and Speech Processing Workshop (ENLSP-IV 2024)