LoRA 与 Dropout 在统一框架下的相遇
计算与语言
2024-05-28 v2 人工智能
摘要
凭借卓越的能力,大语言模型(LLM)已成为众多自然语言处理应用的基本要素,而参数高效微调,尤其是 LoRA,作为一种轻量级的模型定制方法已广受欢迎。同时,各种 dropout 方法最初是为更新所有参数的全量微调设计的,旨在缓解与过度参数冗余相关的过拟合问题。因此,LoRA 的可训练参数极少与先前 dropout 方法的有效性之间可能出现矛盾,而这一点在很大程度上被忽视了。为了填补这一空白,我们首先确认参数高效的 LoRA 也容易过拟合。随后,我们重新审视特定于 Transformer 的 dropout 方法,并在数学和实证上确立了它们的等价性与区别。基于这一比较分析,我们引入了一个统一框架进行全面调查,该框架根据丢弃位置、结构模式和补偿措施实例化了这些方法。通过该框架,我们揭示了它们在涉及有限可训练参数时的新偏好和性能对比。该框架还允许我们将最有利的方面融合成一种名为 HiddenKey 的新型 dropout 方法。大量实验验证了 HiddenKey 在多个模型和任务上的显著优越性和充分性,突显其作为大语言模型高性能和参数高效微调首选方法的地位。
引用
@article{arxiv.2403.00812,
title = {LoRA Meets Dropout under a Unified Framework},
author = {Sheng Wang and Liheng Chen and Jiyue Jiang and Boyang Xue and Lingpeng Kong and Chuan Wu},
journal= {arXiv preprint arXiv:2403.00812},
year = {2024}
}