中文

大型语言模型的二进制神经网络:综合综述

计算与语言 2025-02-27 v1 人工智能

摘要

大型语言模型 (LLM) 在自然语言处理 (NLP) 领域具有广泛应用前景,如 GPT-4 和 Llama。然而,随着模型参数规模的指数增长,LLM 带来了显著的资源开销。低位量化作为关键技术,通过降低模型参数、激活值和梯度的位宽来减少内存使用和计算需求。以往针对 LLM 的量化方法主要采用后训练量化 (PTQ) 和量化感知训练 (QAT)。PTQ 无需对原始模型进行重新训练,而 QAT 则通过在训练期间优化精度来获得最佳量化参数。BitNet 团队提出了一种根本不同的方法,即从模型训练初期就进行量化,利用低精度二进制权重进行训练。这一方法催生了许多针对大型语言模型的二进制量化技术。本文提供了这些二进制量化技术的全面综述。具体而言,我们将介绍深度神经网络中的二进制量化技术,并进一步探讨其在大型语言模型中的应用,回顾它们的各种贡献、实现和应用。

关键词

引用

@article{arxiv.2502.19008,
  title  = {Binary Neural Networks for Large Language Model: A Survey},
  author = {Liangdong Liu and Zhitong Zheng and Cong Wang and Tianhuang Su and Zhenyu Yang},
  journal= {arXiv preprint arXiv:2502.19008},
  year   = {2025}
}

备注

23 pages, 7 figures