基于高效零阶自适应SAM的LORENZA:用于低秩梯度LLM训练以提升泛化性
机器学习
2025-02-28 v1 最优化与控制
机器学习
摘要
我们研究了在严格的计算和内存硬件约束下提高准确性和泛化性的鲁棒参数高效微调(PEFT)技术,特别关注大语言模型(LLMs)。现有的PEFT方法往往缺乏鲁棒性,无法在 diverse 任务上有效泛化,导致实际场景中性能次优。为此,我们提出了新的高效计算框架AdaZo-SAM,将Adam与锐度感知最小化(SAM)结合,仅需在每个迭代中进行一次梯度计算。通过使用随机零阶估计寻找SAM的上升扰动实现。我们为AdaZo-SAM提供收敛保证,表明其改进了基于SOTA PEFT方法的泛化能力。此外,我们设计了一种低秩梯度优化方法LORENZA,其是AdaZo-SAM的内存高效版本。LORENZA利用随机奇异值分解(SVD)方案高效计算子空间投影矩阵,并将优化步骤应用到所选子空间。这一技术使全参数微调能够实现自适应低秩梯度更新,达到与梯度低秩投影方法相同的内存消耗。我们对LORENZA进行收敛分析,展示其在预训练和微调LLMs中的优势。
引用
@article{arxiv.2502.19571,
title = {LORENZA: Enhancing Generalization in Low-Rank Gradient LLM Training via Efficient Zeroth-Order Adaptive SAM},
author = {Yehonathan Refael and Iftach Arbel and Ofir Lindenbaum and Tom Tirer},
journal= {arXiv preprint arXiv:2502.19571},
year = {2025}
}