AdaZeta:自适应零阶张量列适应用于大语言模型的内存高效微调
计算与语言
2024-12-04 v3 人工智能
机器学习
摘要
大语言模型(LLM)微调在各种自然语言处理任务中取得了显著的性能,但随模型规模的增长,对内存需求也日益增长。为解决这一问题,最近提出的内存高效零阶(MeZO)方法试图仅通过前向传播来微调 LLM,从而避免构建反向传播图。然而,这些方法的显著性能下降和高风险发散限制了其广泛采用。本文提出了自适应零阶张量列适应(AdaZeta)框架,专为提高 ZO 方法的性能和收敛性而设计。为增强维度相关的 ZO 估计精度,我们引入了一个快速前向、低参数张量化适配器。为解决大规模 ZO 微调中频繁出现的发散问题,我们提出了一种自适应查询数计划,确保收敛。详细的理论分析和在 Roberta-Large 和 Llama-2-7B 模型上的大量实验结果都证实了我们 AdaZeta 框架在准确性、内存效率和收敛速度方面的有效性。
引用
@article{arxiv.2406.18060,
title = {AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-Tuning},
author = {Yifan Yang and Kai Zhen and Ershad Banijamal and Athanasios Mouchtaris and Zheng Zhang},
journal= {arXiv preprint arXiv:2406.18060},
year = {2024}
}
备注
Accepted for publication in EMNLP 2024