中文

AdaRank:基于不一致性的模块秩预测用于低秩适配

机器学习 2024-08-20 v1

摘要

随着语言和多模态模型规模不断扩大,预训练通用基础模型并针对下游任务进行适配已成为常见做法。为此,适配效率是关键瓶颈,给定大型模型规模后,高效微调方法(如 LoRA)变得尤为重要。然而,LoRA 通常在所有模型层上采用相同的秩,尽管转移学习文献中存在越来越多证据表明,在微调期间,后期层与预训练权重的差异更大。灵感来自关于特征学习和模块关键性的理论与观察,我们开发了一种基于模型不一致性的简单方法,用于预测给定模块相对于其他模块的秩。经验地,AdaRank 在未见数据上显著优于使用相同参数数量的均匀秩。相对于先前工作,AdaRank 的独特优势在于完全保留预训练和适配阶段的原有设置:无需任何额外目标或正则化器,这些可能阻碍适配的准确性和性能。我们的代码已公开 disponible at https://github.com/google-research/google-research/tree/master/adaptive_low_rank。

关键词

引用

@article{arxiv.2408.09015,
  title  = {AdaRank: Disagreement Based Module Rank Prediction for Low-rank Adaptation},
  author = {Yihe Dong},
  journal= {arXiv preprint arXiv:2408.09015},
  year   = {2024}
}