FBI-LLM:通过自回归蒸馏从头开始训练完全二值化大语言模型
计算与语言
2024-07-10 v1 人工智能
机器学习
摘要
本工作提出了 Fully BInarized Large Language Model(FBI-LLM),首次展示了如何从头开始训练大规模二进制语言模型(而非类似 BitNet b1.58 的部分二进制或三值 LLM),以匹配其全精度对应版本(如 FP16 或 BF16)在基于 Transformer 的 LLM 中的性能。它通过采用保持等效模型维度(130M、1.3B、7B)和训练数据量不变的自回归蒸馏(AD)损失,实现了在困惑度和任务特定有效性方面与常规 LLM 预训练相当的成绩。令人惊讶的是,通过分析训练轨迹,我们发现无需预训练权重即可训练二进制 LLM。这项研究鼓励了一种新的计算框架,可能有助于未来设计针对 fully 1-bit LLM 的专用硬件。我们将所有模型、代码和训练数据集完全公开透明,以支持进一步研究(代码:https://github.com/LiqunMa/FBI-LLM。模型:https://huggingface.co/LiqunMa/)
引用
@article{arxiv.2407.07093,
title = {FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation},
author = {Liqun Ma and Mingjie Sun and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2407.07093},
year = {2024}
}
备注
Github at https://github.com/LiqunMa/FBI-LLM