OneBit:迈向极低比特大型语言模型
计算与语言
2024-12-02 v6
摘要
模型量化使用低比特宽值来表示待量化现有模型的权重矩阵,这是一种减少部署备受期待的大型语言模型 (LLMs) 的存储和计算开销的有前景的方法。然而,当前的量化方法在比特宽极度降低时会遭受严重的性能下降,因此专注于利用 4 比特或 8 比特值来量化模型。本文大胆地将 LLMs 的权重矩阵量化为 1 比特,为 LLMs 的极低比特宽部署铺平了道路。针对这一目标,我们引入了一个名为 OneBit 的 1 比特模型压缩框架,包括一种新颖的 1 比特参数表示方法以更好地量化 LLMs,以及一种基于矩阵分解的有效参数初始化方法以提高量化框架的收敛速度。充分的实验结果表明,当仅使用 1 比特权重矩阵时,OneBit 在具有鲁棒训练过程的同时实现了良好的性能(在 LLaMA 模型上至少达到非量化性能的 81%)。
引用
@article{arxiv.2402.11295,
title = {OneBit: Towards Extremely Low-bit Large Language Models},
author = {Yuzhuang Xu and Xu Han and Zonghan Yang and Shuo Wang and Qingfu Zhu and Zhiyuan Liu and Weidong Liu and Wanxiang Che},
journal= {arXiv preprint arXiv:2402.11295},
year = {2024}
}
备注
Accepted by NeurIPS 2024