BitDelta:您的微调可能仅值 1 比特
机器学习
2024-10-15 v3 计算与语言
摘要
大型语言模型 (LLM) 的训练通常分为两个阶段:在大规模互联网数据集上进行预训练,以及针对下游任务进行微调。鉴于预训练的计算需求更高,直观上可以假设微调为模型添加的新信息较少,因此更具可压缩性。我们通过将微调模型的权重分解为其预训练分量和一个额外的增量 (delta) 来探索这一假设。我们提出了一种简单的方法 BitDelta,该方法成功地将此增量量化至 1 比特,且未牺牲性能。这一有趣的发现不仅突显了微调过程中所添加信息的潜在冗余性,而且对微调模型的多租户服务和多租户存储具有重要意义。通过启用单个高精度基座模型配合多个 1 比特增量,BitDelta 将 GPU 内存需求大幅降低了 10 倍以上,这在多租户场景中也可转化为更低的生成延迟。我们在 Llama-2 和 Mistral 模型系列以及高达 700 亿参数的模型上验证了 BitDelta,结果显示在所有测试设置中性能下降极小。
引用
@article{arxiv.2402.10193,
title = {BitDelta: Your Fine-Tune May Only Be Worth One Bit},
author = {James Liu and Guangxuan Xiao and Kai Li and Jason D. Lee and Song Han and Tri Dao and Tianle Cai},
journal= {arXiv preprint arXiv:2402.10193},
year = {2024}
}
备注
NeurIPS 2024 acceptance