秩亦重要:大语言模型微调中适配器专家混合的分层配置
机器学习
2025-02-07 v1 人工智能
摘要
大语言模型 (LLMs) 在各种任务中取得了显著成功,同时其参数规模也在持续增长。参数高效微调 (PEFT) 方法,如低秩适配 (LoRA),通过显著减少可训练参数的数量来应对微调大语言模型的挑战。最近的研究将 LoRA 与专家混合 (MoE) 架构相结合,利用多个适配器专家和门控机制来进一步提高微调性能。然而,现有方法主要侧重于调整每层适配器专家的分配以优化引入的可训练参数规模,却忽略了适配器秩这一关键因素。为此,我们提出了一种专家分配与秩配置的分层方案 HILO,该方案动态调整各层适配器专家的数量和秩,以适配器粒度匹配模型层不同的表示复杂度。在多个基准任务上的大量实验表明,HILO 在引入更少可训练参数的同时,在准确率上优于现有方法,为大语言模型的微调提供了一种高效且实用的解决方案。
引用
@article{arxiv.2502.03884,
title = {Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning},
author = {Peizhuang Cong and Wenpu Liu and Wenhan Yu and Haochen Zhao and Tong Yang},
journal= {arXiv preprint arXiv:2502.03884},
year = {2025}
}