基于自适应贝叶斯子空间优化器的鲁棒高效零阶LLM微调
机器学习
2026-01-19 v4 人工智能
摘要
零阶(ZO)优化可通过函数评估近似梯度,降低大语言模型(LLM)微调的内存需求。然而,现有方法本质上在一维空间中进行更新,在低精度训练下易出现崩溃或显著性能下降。我们引入BSZO(Adaptive Bayesian Subspace Zeroth-Order Optimizer),其通过卡尔曼滤波将多个扰动方向上的有限差分信息在子空间内融合。将每个有限差分测量视为带噪声的观测,BSZO构建子空间投影梯度的后验分布,通过贝叶斯推理进行更新,并采用残差基准机制适应噪声变化。理论分析表明,BSZO的收敛率相较于标准ZO方法提高倍。在RoBERTa、Mistral和OPT模型上的实验表明,BSZO在各种任务中均优于基线方法,在fp16/bf16精度下保持鲁棒性,内存使用仅为推理基线的1.00倍至1.08倍(相对于MeZO)。
引用
@article{arxiv.2601.01452,
title = {Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer},
author = {Jian Feng and Zhihong Huang},
journal= {arXiv preprint arXiv:2601.01452},
year = {2026}
}
备注
23 pages, 2 figures, 5 tables