仅需一个额外的RMSNorm即可实现1.58位精度的微调
计算机与社会
2025-05-15 v1 机器学习
物理与社会
摘要
大型语言模型(LLM)已彻底改变自然语言处理领域,但其规模使得实际部署成本高昂。后训练量化可减少内存和计算资源,但常会降低准确度;而量化感知训练则可在增加训练成本方面恢复性能。将量化推进至三值(2位) regime 可获得更大的节省,但 notoriously 不稳定。建立在最近表明,无偏见、采用RMS归一化的Transformer配合直线估计可达到1.58位精度的工作基础上,我们证明,仅需在每个线性投影前插入RMS归一化,并应用渐进的、按层级的量化计划,即可稳定地将全精度检查点微调为三值 LLM。我们的做法在标准语言模型基准测试中匹配或超越了更复杂的知识蒸馏管道,却不增加模型复杂度。这些结果表明,仅凭谨慎的归一化即可弥合三值 LLM 与全精度 LLM 之间大量准确度差距,使超低位推理变得实用。
引用
@article{arxiv.2505.08822,
title = {The Geography of Transportation Cybersecurity: Visitor Flows, Industry Clusters, and Spatial Dynamics},
author = {Yuhao Wang and Kailai Wang and Songhua Hu and Yunpeng and Zhang and Gino Lim and Pengyu Zhu},
journal= {arXiv preprint arXiv:2505.08822},
year = {2025}
}