中文

分歧中的和谐:迈向快速、准确且内存高效的零阶 LLM 微调

机器学习 2025-11-04 v4 人工智能 计算与语言

摘要

大型语言模型(LLMs)在各种任务中表现出色,但标准的一阶(FO)微调需要大量内存,极大地限制了实际部署。最近,零阶(ZO)优化作为一种有前景的内存高效训练范式脱颖而出,它避免了反向传播,仅依赖前向传播进行梯度估计,使其对资源受限的场景具有吸引力。然而,ZO 方法在收敛速度和准确性方面都远远落后于 FO 方法。为了弥合这一差距,我们引入了一种新颖的逐层分歧分析,揭示了 FO 和 ZO 优化截然不同的更新模式。基于这些发现,为了模拟 FO 方法的学习能力,我们提出了分歧驱动的零阶(DiZO)优化。DiZO 通过将投影纳入 ZO 更新来进行分歧驱动的层自适应,生成精确缩放以适应逐层个体优化需求的多样化幅度更新。我们的结果表明,DiZO 在不牺牲吞吐量的情况下显著减少了收敛所需的迭代次数,在各种数据集上将训练 GPU 小时数减少了高达 48%。此外,在下游任务上微调 RoBERTa-large、OPT 系列和 Llama 系列时,DiZO 始终优于代表性的 ZO 基线,并且在某些情况下甚至超越了内存密集型的 FO 微调。我们的代码发布于 https://github.com/Skilteee/DiZO。

关键词

引用

@article{arxiv.2502.03304,
  title  = {Harmony in Divergence: Towards Fast, Accurate, and Memory-efficient Zeroth-order LLM Fine-tuning},
  author = {Qitao Tan and Jun Liu and Zheng Zhan and Caiwei Ding and Yanzhi Wang and Xiaolong Ma and Jaewoo Lee and Jin Lu and Geng Yuan},
  journal= {arXiv preprint arXiv:2502.03304},
  year   = {2025}
}