中文

BitDistiller:通过自蒸馏释放亚 4 比特大语言模型的潜力

计算与语言 2024-02-19 v1

摘要

大语言模型 (LLM) 的规模化带来了自然语言处理领域的显著进步,但也带来了巨大的部署挑战。权重量化已成为减少内存和计算需求的广泛接受的解决方案。本文介绍了 BitDistiller,这是一个将量化感知训练 (QAT) 与知识蒸馏 (KD) 协同结合的框架,旨在提升超低精度(亚 4 比特)下 LLM 的性能。具体而言,BitDistiller 首先采用定制的不对称量化和裁剪技术,以最大限度地保持量化权重的保真度,然后提出了一种新颖的置信度感知 Kullback-Leibler 散度 (CAKLD) 目标,该目标以自蒸馏方式使用,以实现更快的收敛和更优的模型性能。实证评估表明,BitDistiller 在通用语言理解和复杂推理基准测试的 3 比特和 2 比特配置上均显著优于现有方法。值得注意的是,BitDistiller 被证明更具成本效益,所需数据和训练资源更少。代码地址:https://github.com/DD-DuDa/BitDistiller。

关键词

引用

@article{arxiv.2402.10631,
  title  = {BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-Distillation},
  author = {Dayou Du and Yijia Zhang and Shijie Cao and Jiaqi Guo and Ting Cao and Xiaowen Chu and Ningyi Xu},
  journal= {arXiv preprint arXiv:2402.10631},
  year   = {2024}
}