中文

LBLLM:通过三阶段蒸馏实现大语言模型轻量化二值化

机器学习 2026-04-22 v1 人工智能

摘要

在资源受限的环境中部署大语言模型(LLM)受限于巨大的计算和内存需求。我们提出LBLLM,一种轻量化二值化框架,通过创新的三阶段量化策略实现有效的W(1+1)A4 量化。该框架的工作流程如下:(1)通过PTQ初始化高质量的量化模型;(2)在保持激活全精度的前提下,通过层级蒸馏对二值化权重、组级位图和量化参数进行量化;(3)训练可学习的激活量化因子,以动态将激活量化到4位。该解耦设计消除了权重和激活量化之间的相互干扰,实现更好的训练稳定性和推理准确度。LBLLM仅使用0.016B token 和单张 GPU 即可训练,超越了在W2A4 量化设置下的现有SOTA 二值化方法,在语言建模、常识推理和语言理解等任务上表现更佳。这些结果表明,极端低位量化LLM既可实用又 highly effective,且无需引入额外的高精度通道或旋转矩阵,这些都是近期PTQ 基于方法中常见的做法,为资源受限环境下的LLM 部署指出了一条可行之路。

关键词

引用

@article{arxiv.2604.19167,
  title  = {LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation},
  author = {Siqing Song and Chuang Wang and Yong Lang and Yi Yang and Xu-Yao Zhang},
  journal= {arXiv preprint arXiv:2604.19167},
  year   = {2026}
}