面向基础模型低秩适配器的参数效率微调中的非对称性
机器学习
2024-02-28 v2
摘要
参数高效微调通过更新预训练基础模型的子集参数来优化大型模型;在此类别中,低秩适应(LoRA)尤为有效。灵感来自探究 LoRA 矩阵在微调中不同作用的努力,本文刻画并利用了低秩适配器矩阵重要性非对称性的意外发现。具体而言,当通过添加乘积 来更新神经网络的参数矩阵时,我们注意到 和 矩阵具有不同功能: 从输入中提取特征,而 使用这些特征创建所需输出。基于这一观察,我们证明,微调 比微调 本身更有效,且未训练的随机 应几乎与微调后的 性能相当。我们从信息论的角度也给出了低秩适配器的泛化界限,表明仅训练 的参数节省有助于改善该界限。我们通过在 RoBERTa、BART-Large、LLaMA-2 和 ViT 上进行实验来支持我们的结论。
引用
@article{arxiv.2402.16842,
title = {Asymmetry in Low-Rank Adapters of Foundation Models},
author = {Jiacheng Zhu and Kristjan Greenewald and Kimia Nadjahi and Haitz Sáez de Ocáriz Borde and Rickard Brüel Gabrielsson and Leshem Choshen and Marzyeh Ghassemi and Mikhail Yurochkin and Justin Solomon},
journal= {arXiv preprint arXiv:2402.16842},
year = {2024}
}
备注
17 pages, 2 figures, 9 tables