用于微调大语言模型的零阶优化器学习
机器学习
2025-10-02 v1
摘要
零阶优化器最近作为一种微调大型语言模型 (LLMs) 的实用方法,显著降低了与传统一阶方法相比的 GPU 内存消耗。然而,现有的零阶方法依赖于手工制定的、静态的抽样策略,难以适应模型特定的结构。为此,我们提出了 ZO Fine-tuner,这是一个用于 LLMs 的基于学习的零阶优化器,通过紧凑且高效的设计自动学习高效扰动策略。关键在于,我们观察到只有少数基础模型及其衍生模型在实际中被广泛采用。因此,为给定的 LLM 一次性学习优化器并在 diverse downstream tasks across 之间重用是可行且高度理想的。因此,ZO Fine-tuner 被设计为通过支持每个 LLM 一次性训练并具有最小开销来将学习到学习 (L2L) 扩展到基础模型时代。在 4 个 LLMs 和 7 个数据集上的实验表明,ZO Fine-tuner 在 82.1% 的任务-模型组合中超过先前的零阶基线,从而显示出强大的性能和可扩展性,以实现高效的 LLM 微调。我们的代码可用 at https://github.com/ASTRAL-Group/ZO_Fine_tuner.git。
引用
@article{arxiv.2510.00419,
title = {Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs},
author = {Kairun Zhang and Haoyu Li and Yanjun Zhao and Yifan Sun and Huan Zhang},
journal= {arXiv preprint arXiv:2510.00419},
year = {2025}
}