ApiQ:2比特量化大语言模型的微调
机器学习
2024-06-24 v3 计算与语言
摘要
随着大语言模型(LLM)规模的不断增大,其内存高效微调近期引起了巨大关注,这主要源于 GPU 内存限制带来的约束以及这些方法相较于全量微调的有效性。尽管取得了进展,但当前的内存高效微调策略,如 QLoRA,在不同的比特宽量化及多方面任务中表现出不一致的性能。这种不一致很大程度上源于量化过程对已保留知识的破坏性影响,导致灾难性遗忘,并削弱了预训练模型在微调中的利用。在这项工作中,我们引入了一个新颖的量化框架 ApiQ,旨在通过同时初始化 LoRA 组件和量化 LLM 的权重来恢复因量化而丢失的信息。这种方法确保了原始 LLM 激活精度的维持,同时减轻了从浅层到深层的误差传播。通过在多种语言任务上使用各种 LLM 进行的综合评估,ApiQ 明显最小化了量化过程中的激活误差。因此,它在各种比特宽度下均能持续取得优越的微调结果。
引用
@article{arxiv.2402.05147,
title = {ApiQ: Finetuning of 2-Bit Quantized Large Language Model},
author = {Baohao Liao and Christian Herold and Shahram Khadivi and Christof Monz},
journal= {arXiv preprint arXiv:2402.05147},
year = {2024}
}
备注
more benchmarks and new method, block-wise ApiQ. code: https://github.com/BaohaoLiao/ApiQ