BiDoRA:基于双层优化的权重分解低秩适配
机器学习
2025-08-05 v2 计算与语言
摘要
参数高效微调(PEFT)是一种灵活且高效的为大型语言模型(LLM)适应下游任务的方法。在这些方法中,权重分解低秩适配(DoRA)是一种具有前景的 approach,它将权重矩阵分解为幅度和方向分量,以更好地模拟完整微调(FT)。然而,DoRA同时优化这些分量会导致过度表达,增加过拟合风险,并创建受限的学习能力的耦合更新模式。为此,本文提出一种基于双层优化框架的权重分解低秩适配(BiDoRA),这是一种新的PEFT方法。BiDoRA与DoRA根本不同,采用双层优化框架分别异步地优化幅度和方向,使用不同的训练和验证数据分割。这种解耦优化过程有效缓解了过拟合,允许更灵活的更新,使其更接近FT。例如,权重分解分析显示,BiDoRA实现的幅度-方向更新相关系数为-8.042,显著接近于DoRA的-1.784(相对于FT的理想值)。在涵盖自然语言理解、生成、标记分类和极小 biomedical 数据集的各种任务上评估BiDoRA时,结果表明其持续优于DoRA和广泛领先的PEFT方法。这种改进是统计学上显著的,如下图在GLUE基准测试中所示,BiDoRA相对于DoRA的p值为(基于Wilcoxon符号秩检验)。BiDoRA的代码已公开:https://github.com/t2ance/BiDoRA。
引用
@article{arxiv.2410.09758,
title = {BiDoRA: Bi-level Optimization-Based Weight-Decomposed Low-Rank Adaptation},
author = {Peijia Qin and Ruiyi Zhang and Pengtao Xie},
journal= {arXiv preprint arXiv:2410.09758},
year = {2025}
}