中文

通过慢速级联学习实现大模型的高表达性和通用性低秩适配

计算与语言 2024-07-02 v1 计算机视觉与模式识别

摘要

高效微调是现代大模型中的基本作用,低秩适配(LoRA)已成为尤为有前景的一种方法。然而,现有LoRA变体受限于表达能力有限、倾向于过拟合以及对超参数设置敏感等问题。本文提出了LoRA慢速级联学习(LoRASC),一种创新性技术,旨在增强LoRA的表达能力和泛化能力,同时保持其训练效率。我们的做法通过级联学习策略实现表达力度提升,使其能够实现混合低秩适配,从而增加模型捕捉复杂模式的能力。此外,我们引入慢速-快速更新机制和级联噪声调优,以增强泛化性。在各种语言和视觉数据集上进行的广泛实验表明,所提出的方法不仅显著优于现有基线,还能缓解过拟合,提高模型稳定性,并提升OOD鲁棒性。代码将很快在https://github.com/microsoft/LoRASC发布。

关键词

引用

@article{arxiv.2407.01491,
  title  = {Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning},
  author = {Siwei Li and Yifan Yang and Yifei Shen and Fangyun Wei and Zongqing Lu and Lili Qiu and Yuqing Yang},
  journal= {arXiv preprint arXiv:2407.01491},
  year   = {2024}
}