AdaMeZO:无需维护时序矩的Adam式零阶优化器
机器学习
2026-05-04 v1 人工智能
摘要
对LLM进行微调是完成各种特定下游任务所必需的,但经典的基于反向传播的微调方法需要大量GPU内存。 为此,近期方法MeZO仅依赖前向传播即可完成微调,显著降低了GPU需求,但由于对损失景观漠视,收敛速度较慢。 标准解决方案如Adam,通过估计一阶和二阶矩并存储于内存中,以引导模型在曲率较小的维度上移动,反之亦然。 但直接应用Adam会消除MeZO的优势,因为它会使内存需求翻倍。在此基础上,我们提出AdaMeZO,一种零阶优化器,利用Adam式的一阶和二阶矩估计,但无需在内存中维护这些矩。 我们对AdaMeZO进行了理论分析,并通过大量实验验证其性能,表明AdaMeZO能够在所需的前向传递次数降低最高70%的同时超越MeZO。 轨迹可视化证实了AdaMeZO适应多样化损失景观的能力。
引用
@article{arxiv.2605.00650,
title = {AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments},
author = {Zhijie Cai and Haolong Chen and Guangxu Zhu},
journal= {arXiv preprint arXiv:2605.00650},
year = {2026}
}