大型语言模型的二进制神经网络:综合综述
计算与语言
2025-02-27 v1 人工智能
摘要
大型语言模型 (LLM) 在自然语言处理 (NLP) 领域具有广泛应用前景,如 GPT-4 和 Llama。然而,随着模型参数规模的指数增长,LLM 带来了显著的资源开销。低位量化作为关键技术,通过降低模型参数、激活值和梯度的位宽来减少内存使用和计算需求。以往针对 LLM 的量化方法主要采用后训练量化 (PTQ) 和量化感知训练 (QAT)。PTQ 无需对原始模型进行重新训练,而 QAT 则通过在训练期间优化精度来获得最佳量化参数。BitNet 团队提出了一种根本不同的方法,即从模型训练初期就进行量化,利用低精度二进制权重进行训练。这一方法催生了许多针对大型语言模型的二进制量化技术。本文提供了这些二进制量化技术的全面综述。具体而言,我们将介绍深度神经网络中的二进制量化技术,并进一步探讨其在大型语言模型中的应用,回顾它们的各种贡献、实现和应用。
引用
@article{arxiv.2502.19008,
title = {Binary Neural Networks for Large Language Model: A Survey},
author = {Liangdong Liu and Zhitong Zheng and Cong Wang and Tianhuang Su and Zhenyu Yang},
journal= {arXiv preprint arXiv:2502.19008},
year = {2025}
}
备注
23 pages, 7 figures