作为稀疏性正则化器以控制过拟合的 LoRA Dropout
机器学习
2024-04-16 v1 人工智能
摘要
以 LoRA 为代表的参数高效微调方法在将大规模预训练模型适配至下游任务中发挥着重要作用。然而,微调 LoRA 系列模型同样面临在训练数据集上过拟合的风险,且目前仍缺乏控制基于 LoRA 的 PEFT 方法过拟合的理论指导与实际机制。本文通过向可学习的低秩矩阵引入随机噪声并增加参数稀疏性,提出了一种用于基于 LoRA 的方法的 LoRA Dropout 机制。随后,我们通过在该框架下提供泛化误差界,从稀疏性正则化的角度论证了 LoRA Dropout 机制的理论原理。理论结果表明,适当的稀疏性有助于缩小经验风险与泛化风险之间的差距,从而控制过拟合。此外,基于 LoRA Dropout 框架,我们引入了一种测试时集成策略,并提供了理论证据表明该集成方法可以进一步压缩误差界,从而在推理阶段带来更好的性能。在多种 NLP 任务上的广泛实验为我们的 LoRA Dropout 框架在提升模型准确性与校准方面的有效性提供了实践验证。
引用
@article{arxiv.2404.09610,
title = {LoRA Dropout as a Sparsity Regularizer for Overfitting Control},
author = {Yang Lin and Xinyu Ma and Xu Chu and Yujie Jin and Zhibang Yang and Yasha Wang and Hong Mei},
journal= {arXiv preprint arXiv:2404.09610},
year = {2024}
}