BitNet蒸馏
机器学习
2025-10-17 v1 计算与语言
摘要
在本文中,我们提出了BitNet蒸馏(BitDistill),这是一个轻量级流程,它将现成的全精度LLM(例如Qwen)微调为1.58位精度(即三元权重{-1, 0, 1}),用于特定的下游任务,以最小的计算成本实现了强大的任务特定性能。具体来说,BitDistill融合了三种关键技术:BitNet中引入的SubLN模块;基于MiniLM的多头注意力蒸馏;以及持续预训练,它作为一个关键的热身步骤,以缓解在特定任务上微调后的全精度LLM与1.58位LLM之间性能差距的可扩展性问题。实验结果表明,BitDistill在不同模型规模上实现了与全精度对应模型相当的性能,同时在CPU上实现了高达10倍的内存节省和2.65倍的推理加速。代码可在https://github.com/microsoft/BitNet获取。
引用
@article{arxiv.2510.13998,
title = {BitNet Distillation},
author = {Xun Wu and Shaohan Huang and Wenhui Wang and Ting Song and Li Dong and Yan Xia and Furu Wei},
journal= {arXiv preprint arXiv:2510.13998},
year = {2025}
}
备注
12 pages, 4 figures