QuZO:用于大型语言模型的量化零阶微调
机器学习
2025-02-19 v1 人工智能
摘要
大型语言模型(LLM)通常会被量化以降低推理时的内存成本和延迟。然而,量化常常会导致模型性能下降,因此需要针对各种下游任务进行微调。传统的微调方法,如随机梯度下降和 Adam 优化,都需要反向传播,在低精度设置下容易出错。为克服这些限制,我们提出了 Quantized Zeroth-Order(QuZO)框架,专为通过低精度(例如 4 位或 8 位)前向传播来微调 LLM 而设计。该方法可以避免低精度直向估计器中常见的错误,并利用优化随机取整来减轻偏置增加。QuZO 简化了训练过程,同时在 和 、 训练中实现了与一阶方法相当甚至更好的准确率。实验表明,低位训练的 QuZO 在 GLUE、Multi-Choice 和 Generation 任务上,性能可与 MeZO 优化相媳美,同时在 LLaMA2-7B 微调中相较于量化的一阶方法,内存成本降低 。
引用
@article{arxiv.2502.12346,
title = {QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models},
author = {Jiajun Zhou and Yifan Yang and Kai Zhen and Ziyue Liu and Yequan Zhao and Ershad Banijamali and Athanasios Mouchtaris and Ngai Wong and Zheng Zhang},
journal= {arXiv preprint arXiv:2502.12346},
year = {2025}
}