1-bit LLM 时代:所有大型语言模型均为 1.58 比特
计算与语言
2024-02-28 v1 机器学习
摘要
最近的研究(如 BitNet)正在为 1-bit 大型语言模型 (LLMs) 的新时代铺平道路。在本工作中,我们引入了一种 1-bit LLM 变体,即 BitNet b1.58,其中 LLM 的每个参数(或权重)均为三值 {-1, 0, 1}。在相同的模型大小和训练 token 数量下,它在困惑度 (perplexity) 和端到端任务性能方面与全精度(即 FP16 或 BF16)Transformer LLM 相匹配,同时在延迟、内存、吞吐量和能耗方面具有显著的成本效益。更深刻的是,1.58-bit LLM 定义了一种新的缩放定律和训练新一代高性能且具成本效益的 LLMs 的配方。此外,它启用了一种新的计算范式,并为设计专为 1-bit LLMs 优化的硬件打开了大门。
引用
@article{arxiv.2402.17764,
title = {The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits},
author = {Shuming Ma and Hongyu Wang and Lingxiao Ma and Lei Wang and Wenhui Wang and Shaohan Huang and Li Dong and Ruiping Wang and Jilong Xue and Furu Wei},
journal= {arXiv preprint arXiv:2402.17764},
year = {2024}
}
备注
Work in progress