用于微调语言模型的方差缩减零阶方法
机器学习
2024-04-15 v1 人工智能
计算与语言
最优化与控制
摘要
微调语言模型(LM)在广泛的下游任务中展现出了成功。然而,随着 LM 规模的扩大,反向传播的内存需求变得极其高昂。零阶(ZO)优化方法可以利用内存高效的前向传播来估计梯度。最近,作为 ZO-SGD 的一种变体,MeZO 被证明在与合适的任务提示结合时,能够持续优于零样本和上下文学习。在本工作中,我们将 ZO 方法与方差缩减技术相结合,以增强基于推理的 LM 微调的稳定性和收敛性。我们引入了内存高效的零阶随机方差缩减梯度(MeZO-SVRG),并展示了其在多个 LM 微调任务上的有效性,消除了对特定任务提示的依赖。在基准 GLUE 任务上对一系列掩码和自回归 LM 进行评估时,MeZO-SVRG 优于 MeZO,在全参数和部分参数微调设置下测试准确率最高提升 20%。MeZO-SVRG 受益于计算时间的减少,它通常在 GPU 小时减少 的情况下即可超越 MeZO 的峰值测试准确率。与一阶 SGD 相比,MeZO-SVRG 显著减少了所需的内存占用,例如对于自回归模型减少了 。我们的实验强调,与 SGD 相比,随着批大小的增加,MeZO-SVRG 的内存节省效果逐步提升。
引用
@article{arxiv.2404.08080,
title = {Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models},
author = {Tanmay Gautam and Youngsuk Park and Hao Zhou and Parameswaran Raman and Wooseok Ha},
journal= {arXiv preprint arXiv:2404.08080},
year = {2024}
}
备注
29 pages, 25 tables, 9 figures