BitNet:面向大语言模型的可扩展 1-bit Transformer 架构
计算与语言
2023-10-18 v1
摘要
大语言模型规模的不断增长给部署带来了挑战,并因高能耗引发了环境影响方面的担忧。在这项工作中,我们提出了 BitNet,一种为大型语言模型设计的可扩展且稳定的 1-bit Transformer 架构。具体而言,我们引入 BitLinear 作为 nn.Linear 层的直接替代,以从头训练 1-bit 权重。在语言建模上的实验结果表明,与最先进的 8-bit 量化方法和 FP16 Transformer 基线相比,BitNet 在大幅减少内存占用和能耗的同时取得了具有竞争力的性能。此外,BitNet 展现出与全精度 Transformer 类似的缩放定律,表明其在保持效率和性能优势的同时,具有有效扩展到更大语言模型的潜力。
引用
@article{arxiv.2310.11453,
title = {BitNet: Scaling 1-bit Transformers for Large Language Models},
author = {Hongyu Wang and Shuming Ma and Li Dong and Shaohan Huang and Huaijie Wang and Lingxiao Ma and Fan Yang and Ruiping Wang and Yi Wu and Furu Wei},
journal= {arXiv preprint arXiv:2310.11453},
year = {2023}
}
备注
Work in progress