中文

BitNet a4.8:1 位大语言模型的 4 位激活

计算与语言 2024-11-08 v1 机器学习

摘要

关于 1 位大语言模型(LLMs)的最新研究(如 BitNet b1.58)展现了在保持性能的同时降低 LLM 推理成本的有前景方向。在本工作中,我们引入了 BitNet a4.8,为 1 位大语言模型启用 4 位激活。BitNet a4.8 采用混合量化和稀疏化策略,以缓解离群通道引入的量化误差。具体而言,我们对注意力层和前馈网络层的输入使用 4 位激活,同时对中间状态进行稀疏化处理,随后采用 8 位量化。大量实验表明,BitNet a4.8 在等效训练成本下实现了与 BitNet b1.58 相当的性能,同时通过启用 4 位(INT4/FP4)内核实现了更快的推理速度。此外,BitNet a4.8 仅激活 55% 的参数,并支持 3 位 KV 缓存,进一步提升了大规模 LLM 部署和推理的效率。

关键词

引用

@article{arxiv.2411.04965,
  title  = {BitNet a4.8: 4-bit Activations for 1-bit LLMs},
  author = {Hongyu Wang and Shuming Ma and Furu Wei},
  journal= {arXiv preprint arXiv:2411.04965},
  year   = {2024}
}

备注

Work in progress