中文

利用坐标动量在 SignSGD 与 Muon 中的 JAGUAR:面向大语言模型的内存优化零阶方法

机器学习 2025-10-17 v4 最优化与控制

摘要

微调大型语言模型 (LLM) 是将预训练模型适用于下游任务的关键步骤。然而,诸如随机梯度下降 (SGD) 和 Adam 等传统一阶优化器在模型规模扩大时会导致昂贵的内存和计算成本。本文探讨将零阶 (ZO) 优化方法作为替代方案,尤其是在参数高效微调技术如 LoRA 的上下文中。我们提出 JAGUAR SignSGD\texttt{JAGUAR SignSGD},一种基于动量的 ZO 算法,扩展自 ZO SignSGD,仅需与标准 ZO SGD 相同的参数数量,每迭代仅需 O(1)\mathcal{O}(1) 次函数评估。我们在本文中首次为随机 ZO 情况下的 SignSGD 提供严格的收敛保证。进一步,我们提出 JAGUAR Muon\texttt{JAGUAR Muon},一种新型 ZO Muon 优化器的变体,利用模型参数的矩阵结构,并在任意随机噪声下给出其收敛率。通过在具有挑战性的 LLM 微调基准测试上进行大量实验,我们证明所提方法在收敛质量上可达甚至超越标准一阶方法,实现显著内存降低。我们的理论与实证结果为资源受限的 LLM 适应提供了实用且理论依据的零阶优化方法。代码已公开于 https://github.com/brain-mmo-lab/ZO_LLM。

关键词

引用

@article{arxiv.2506.04430,
  title  = {Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order},
  author = {Egor Petrov and Grigoriy Evseev and Aleksey Antonov and Andrey Veprikov and Nikolay Bushkov and Stanislav Moiseev and Aleksandr Beznosikov},
  journal= {arXiv preprint arXiv:2506.04430},
  year   = {2025}
}

备注

26 pages, 5 tables