面向 4 位量化的异常安全预训练:提升大语言模型的鲁棒性
机器学习
2025-06-25 v1 人工智能
计算与语言
摘要
大语言模型 (LLM) 中的极端激活异常值在 4 位量化中严重降低性能,阻碍了高效的设备端部署。虽然通道级操作和自适应梯度缩放被认识为主要原因,但实际的缓解措施仍富有挑战性。我们提出异常安全预训练 (OSP),一种主动防止异常形成而非依赖事后缓解的实用方法。OSP 结合了三个关键创新:(1) Muon 优化器,消除特权基底同时保持训练效率;(2) 单尺度 RMSNorm,防止通道级放大;(3) 可学习嵌入投影,重新分配源自嵌入矩阵的激活幅值。我们通过在 1 万亿标记上训练 14 亿参数模型来验证 OSP,这是首个无此类异常的生产规模 LLM。在激进的 4 位量化下,我们的 OSP 模型在 10 个基准测试中获得 35.7 的平均分数(相较于 Adam 训练模型的 26.5),仅增加 2% 的训练开销。令人惊讶的是,OSP 模型的近零超值峰度为 0.04,与标准模型的极端值 1818.56 相比,根本性地改变了 LLM 量化行为。我们的工作表明,异常并非 LLM 的固有属性,而是训练策略的结果,为更高效的 LLM 部署铺平了道路。源代码和预训练模型可在 https://github.com/dmis-lab/Outlier-Safe-Pre-Training 提供。
引用
@article{arxiv.2506.19697,
title = {Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models},
author = {Jungwoo Park and Taewhoo Lee and Chanwoong Yoon and Hyeon Hwang and Jaewoo Kang},
journal= {arXiv preprint arXiv:2506.19697},
year = {2025}
}