中文

RankAdaptor:面向被修剪大语言模型高效微调的分层秩分配方法

计算与语言 2024-12-17 v2 人工智能

摘要

大语言模型(LLM)的高效压缩日益受到关注。然而,恢复压缩后大语言模型的性能仍然面临主要挑战。当前的大语言模型压缩实践涉及结构化剪枝,随后通过低秩适应(LoRA)算法进行恢复。结构化剪枝对模型架构的不均匀修改,加上标准LoRA在在线流程中对各层的固定配置分配,导致被修剪模型在各种下游任务中表现次优。为此,我们引入RankAdaptor,一种分层秩分配方法,使其能够根据各层特定的恢复需求高效微调被修剪后的大语言模型。我们采用一种性能模型,该模型在离线元学习和在线增量学习中探索每个层的最优秩值。广泛的实验表明,RankAdaptor 在各种剪枝设置和大语言模型架构上均显著优于当前最先进的方法,改进幅度范围为 0.7\% 至 5.5\%。

关键词

引用

@article{arxiv.2406.15734,
  title  = {RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model},
  author = {Changhai Zhou and Shijie Han and Lining Yang and Yuhua Zhou and Xu Cheng and Yibin Wang and Hongguang Li},
  journal= {arXiv preprint arXiv:2406.15734},
  year   = {2024}
}