利用坐标动量在 SignSGD 与 Muon 中的 JAGUAR:面向大语言模型的内存优化零阶方法
机器学习
2025-10-17 v4 最优化与控制
摘要
微调大型语言模型 (LLM) 是将预训练模型适用于下游任务的关键步骤。然而,诸如随机梯度下降 (SGD) 和 Adam 等传统一阶优化器在模型规模扩大时会导致昂贵的内存和计算成本。本文探讨将零阶 (ZO) 优化方法作为替代方案,尤其是在参数高效微调技术如 LoRA 的上下文中。我们提出 ,一种基于动量的 ZO 算法,扩展自 ZO SignSGD,仅需与标准 ZO SGD 相同的参数数量,每迭代仅需 次函数评估。我们在本文中首次为随机 ZO 情况下的 SignSGD 提供严格的收敛保证。进一步,我们提出 ,一种新型 ZO Muon 优化器的变体,利用模型参数的矩阵结构,并在任意随机噪声下给出其收敛率。通过在具有挑战性的 LLM 微调基准测试上进行大量实验,我们证明所提方法在收敛质量上可达甚至超越标准一阶方法,实现显著内存降低。我们的理论与实证结果为资源受限的 LLM 适应提供了实用且理论依据的零阶优化方法。代码已公开于 https://github.com/brain-mmo-lab/ZO_LLM。
引用
@article{arxiv.2506.04430,
title = {Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order},
author = {Egor Petrov and Grigoriy Evseev and Aleksey Antonov and Andrey Veprikov and Nikolay Bushkov and Stanislav Moiseev and Aleksandr Beznosikov},
journal= {arXiv preprint arXiv:2506.04430},
year = {2025}
}
备注
26 pages, 5 tables