中文

BitNet b1.58 2B4T 技术报告

计算与语言 2025-04-28 v2 机器学习

摘要

我们介绍了 BitNet b1.58 2B4T,这是首个在 20 亿参数规模上的开源原生 1 位大型语言模型(LLM)。该模型在 4 万亿 token 的语料库上进行训练,并在涵盖语言理解、数学推理、编程能力和会话能力的基准测试中进行了严格评估。我们的结果表明,BitNet b1.58 2B4T 的性能与同等规模的领先开权重全精度 LLM 相当,同时在计算效率方面具有显著优势,包括大幅减少的内存占用、能耗和解码延迟。为了促进进一步的研究和应用,该模型权重已通过 Hugging Face 发布,并附带了适用于 GPU 和 CPU 架构的开源推理实现。

关键词

引用

@article{arxiv.2504.12285,
  title  = {BitNet b1.58 2B4T Technical Report},
  author = {Shuming Ma and Hongyu Wang and Shaohan Huang and Xingxing Zhang and Ying Hu and Ting Song and Yan Xia and Furu Wei},
  journal= {arXiv preprint arXiv:2504.12285},
  year   = {2025}
}

备注

Work in progress