中文

面向基础模型低秩适配器的参数效率微调中的非对称性

机器学习 2024-02-28 v2

摘要

参数高效微调通过更新预训练基础模型的子集参数来优化大型模型;在此类别中,低秩适应(LoRA)尤为有效。灵感来自探究 LoRA 矩阵在微调中不同作用的努力,本文刻画并利用了低秩适配器矩阵重要性非对称性的意外发现。具体而言,当通过添加乘积 BABA 来更新神经网络的参数矩阵时,我们注意到 BBAA 矩阵具有不同功能:AA 从输入中提取特征,而 BB 使用这些特征创建所需输出。基于这一观察,我们证明,微调 BB 比微调 AA 本身更有效,且未训练的随机 AA 应几乎与微调后的 AA 性能相当。我们从信息论的角度也给出了低秩适配器的泛化界限,表明仅训练 BB 的参数节省有助于改善该界限。我们通过在 RoBERTa、BART-Large、LLaMA-2 和 ViT 上进行实验来支持我们的结论。

关键词

引用

@article{arxiv.2402.16842,
  title  = {Asymmetry in Low-Rank Adapters of Foundation Models},
  author = {Jiacheng Zhu and Kristjan Greenewald and Kimia Nadjahi and Haitz Sáez de Ocáriz Borde and Rickard Brüel Gabrielsson and Leshem Choshen and Marzyeh Ghassemi and Mikhail Yurochkin and Justin Solomon},
  journal= {arXiv preprint arXiv:2402.16842},
  year   = {2024}
}

备注

17 pages, 2 figures, 9 tables