LoRA-MGPO:通过动量引导扰动优化缓解低秩适应中的双下降现象
计算与语言
2025-09-29 v3
摘要
参数高效微调(PEFT),特别是低秩适应(LoRA),通过仅训练少数参数来适应大型语言模型(LLM)。然而,随着用于适应的低秩矩阵秩的增加,LoRA 常常表现出不稳定的“双下降”现象,表现为训练损失的暂时发散,延迟收敛并因陷入尖锐局部极小值而损害泛化能力。为此,我们引入 LoRA-MGPO 框架, incorporates 动量引导扰动优化(MGPO)。MGPO 通过缓解双下降现象并利用优化器状态中的动量向量引导权重扰动,从而避免双梯度计算。此外,采用自适应归一化方案,基于梯度范数的指数移动平均(EMA)缩放扰动幅度,以进一步提升稳定性。虽然 EMA 控制扰动的幅度,MGPO 仍引导其方向,确保更稳定的优化轨迹。在自然语言理解和生成基准测试套件上的实验表明,LoRA-MGPO 在 LoRA 和其他 PEFT 方法中始终实现优异性能。分析表明,LoRA-MGPO 导致损失曲线更平滑、收敛更快,并通过稳定训练过程并缓解对尖锐极小值的吸引,实现更好的泛化。
引用
@article{arxiv.2502.14538,
title = {LoRA-MGPO: Mitigating Double Descent in Low-Rank Adaptation via Momentum-Guided Perturbation Optimization},
author = {Yupeng Chang and Chenlu Guo and Yi Chang and Yuan Wu},
journal= {arXiv preprint arXiv:2502.14538},
year = {2025}
}