QuAILoRA:面向 LoRA 的量子化感知初始化
机器学习
2024-10-22 v1 计算与语言
摘要
QLoRA 通过对基础大语言模型进行量子化来降低 LoRA 微调的内存成本。然而,量子化会引入量子化误差,导致微调后模型性能下降。本文我们引入 QuAILoRA,一种用于 LoRA 的量子化感知初始化方法,通过降低初始化时的量子化误差来缓解这一负面影响。我们的方法在计算开销上仅增加少量计算量,而不会增加微调的内存成本。我们在多个因果语言建模和下游评估任务上使用多种不同模型规模和家族进行评估。我们观察到几乎所有使用 QuAILoRA 微调的大语言模型在验证困惑度方面均取得更好表现。在下游任务评估中,我们发现 QuAILoRA 能获得与将量子化精度提升至 8 位相当于 4 位 QLoRA 模型的 75% 验证困惑度下降和 86% 的下游任务准确率提升,期间未增加微调期间的 GPU 内存利用。
引用
@article{arxiv.2410.14713,
title = {QuAILoRA: Quantization-Aware Initialization for LoRA},
author = {Neal Lawton and Aishwarya Padmakumar and Judith Gaspers and Jack FitzGerald and Anoop Kumar and Greg Ver Steeg and Aram Galstyan},
journal= {arXiv preprint arXiv:2410.14713},
year = {2024}
}
备注
12 pages, 7 figures. Submitted to the 4th NeurIPS Workshop on Efficient Natural Language and Speech Processing (ENLSP-IV)