中文

超越 LoRA 与全参数微调:基于梯度的优化器路由适配大语言模型

计算与语言 2026-05-19 v2 人工智能

摘要

近期关于大语言模型微调的文献突显了一场根本性的论战。虽然全参数微调(FFT)提供了实现高熵知识注入所需的 representational 灵活性,但低秩适应(LoRA)能够匹配或超越 FFT 性能,因为许多任务只需要在低秩空间内进行更新,并受益于 LoRA 的额外正则化。通过在 diverse 任务(SQL、医学问答、反事实知识)和不同语言模型(Gemma-3-1B、Qwen2.5-1.5B、Qwen2.5-3B)上进行经验评估,我们验证了两者的趋势,并演示了仅依赖单一静态架构在结构上受限。为解决这一挑战,我们提出了 LoRA 与全参数混合(MoLF)微调,一个统一框架,使训练期间能够在两者之间进行连续导航。MoLF 在优化器层面动态路由更新,以确保 exact 梯度信号在两个专家之间持续可用,从而实现稳定的训练动力学。对于内存受限环境,我们还引入了 MoLF-Efficient,该方法冻结基础权重,仅在可能具有不同秩的 LoRA 专家之间路由更新。我们的评估表明,MoLF 在所有设置下均改进了或保持在 FFT 与 LoRA 中较者之 1.5%1.5\% 以内,而 MoLF-Efficient 在 Fact、Med 和 SQL 任务上分别比以前的自适应 LoRA 方法提高了最高可达 20%20\%9%9\%。我们的代码已开源于 https://github.com/11785T23/molf.git。

关键词

引用

@article{arxiv.2605.07111,
  title  = {Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation},
  author = {Haozhan Tang and Xiuqi Zhu and Xinyin Zhang and Boxun Li and Virginia Smith and Kevin Kuo},
  journal= {arXiv preprint arXiv:2605.07111},
  year   = {2026}
}