中文

QuZO:用于大型语言模型的量化零阶微调

机器学习 2025-02-19 v1 人工智能

摘要

大型语言模型(LLM)通常会被量化以降低推理时的内存成本和延迟。然而,量化常常会导致模型性能下降,因此需要针对各种下游任务进行微调。传统的微调方法,如随机梯度下降和 Adam 优化,都需要反向传播,在低精度设置下容易出错。为克服这些限制,我们提出了 Quantized Zeroth-Order(QuZO)框架,专为通过低精度(例如 4 位或 8 位)前向传播来微调 LLM 而设计。该方法可以避免低精度直向估计器中常见的错误,并利用优化随机取整来减轻偏置增加。QuZO 简化了训练过程,同时在 FP8{\rm FP}8INT8{\rm INT}8INT4{\rm INT}4 训练中实现了与一阶方法相当甚至更好的准确率。实验表明,低位训练的 QuZO 在 GLUE、Multi-Choice 和 Generation 任务上,性能可与 MeZO 优化相媳美,同时在 LLaMA2-7B 微调中相较于量化的一阶方法,内存成本降低 2.94×2.94 \times

关键词

引用

@article{arxiv.2502.12346,
  title  = {QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models},
  author = {Jiajun Zhou and Yifan Yang and Kai Zhen and Ziyue Liu and Yequan Zhao and Ershad Banijamali and Athanasios Mouchtaris and Ngai Wong and Zheng Zhang},
  journal= {arXiv preprint arXiv:2502.12346},
  year   = {2025}
}