中文

用于内存高效 LLM 微调的先验信息零阶优化与自适应方向对齐

计算与语言 2026-01-09 v1 机器学习

摘要

微调大语言模型(LLM)在各种 NLP 任务中取得了显著成功,但反向传播过程中巨大的内存开销仍是关键瓶颈,随着模型规模增长尤为突出。零阶(ZO)优化通过前向传播和高斯采样估计梯度,避免了反向传播,从而缓解了这一问题。然而,传统 ZO 方法由于依赖随机扰动,在梯度估计中存在高方差,导致收敛缓慢且性能欠佳。我们提出一种简单的即插即用方法,引入先验信息扰动以改进梯度估计。该方法从高斯样本中动态计算引导向量,将扰动导向更具信息量的方向,与标准 ZO 方法相比显著加速了收敛。我们进一步研究了贪婪扰动策略,以探索先验知识对梯度估计的影响。理论上,我们证明我们的梯度估计器与真实梯度方向实现了更强的对齐,提升了优化效率。在不同规模和架构的 LLM 上的大量实验表明,我们提出的方法可无缝集成至现有优化方法中,提供更快的收敛速度与更优的性能。值得注意的是,在 OPT-13B 模型上,我们的方法在所有 11 个基准任务上均优于传统 ZO 优化,并在 11 个任务中的 9 个上超越了基于梯度的基线,在效率与准确性之间建立了稳健的平衡。

关键词

引用

@article{arxiv.2601.04710,
  title  = {Prior-Informed Zeroth-Order Optimization with Adaptive Direction Alignment for Memory-Efficient LLM Fine-Tuning},
  author = {Feihu Jin and Shipeng Cen and Ying Tan},
  journal= {arXiv preprint arXiv:2601.04710},
  year   = {2026}
}

备注

12pages, 6figures