大语言模型精调中的零阶优化低秩曲率
机器学习
2025-11-12 v1
摘要
我们提出LOREN,是用于大语言模型(LLM)精调的曲率感知零阶(ZO)优化方法。现有ZO方法通过随机扰动估计梯度,常因高方差和次优搜索方向而受限。我们的ethods addresses这些挑战通过:(i) 将梯度预条件化问题重新表述为自适应估计梯度估计的各向异性扰动分布的问题,(ii) 使用自然演化策略框架捕获曲率,通过低秩块对角预条件器实现,(iii) 应用REINFORCE leave-one-out(RLOO)梯度估计以降低方差。在标准LLM基准测试中实验,表明我们的方法在准确率和收敛速度上优于最先进的ZO方法,同时相较于MeZO-Adam将峰值内存使用降低最高可达27.3%。
引用
@article{arxiv.2511.07971,
title = {Low-Rank Curvature for Zeroth-Order Optimization in LLM Fine-Tuning},
author = {Hyunseok Seung and Jaewoo Lee and Hyunsuk Ko},
journal= {arXiv preprint arXiv:2511.07971},
year = {2025}
}
备注
Accepted to the AAAI Conference on Artificial Intelligence (AAAI-2026)