中文

MuonQ:通过方向保真度优化增强低位Muon量化

机器学习 2026-05-13 v1

摘要

Muon优化器已成为训练大语言模型时Adam的一个引人注目的替代方案,通过梯度正交化实现了显著的计算节省。然而,Muon的优化器状态对量化误差更敏感:因为正交化丢弃了奇异值的幅度而仅保留方向信息,所以即使奇异向量方向上的微小量化误差也会在更新中被放大。在这项工作中,我们提出了MuonQ,一个基于方向保真度优化原理的低位Muon训练框架。首先,我们应用预量化归一化,使得每一步引入的量化误差具有相同的幅度,防止累积误差形成优势方向。其次,我们引入一种结构分解,通过幂迭代分别量化主导奇异分量,确保量化误差仅扰动奇异值幅度,而不是旋转奇异向量方向。第三,我们采用μ律压扩量化,为密集分布的动量值分配更高的分辨率,将量化目标从异常值保留转变为密集区域的可区分性。这些技术共同实现了Muon优化器状态的稳定4位量化。在GPT风格和LLaMA风格模型上的预训练实验表明,4位精度的MuonQ在训练损失和下游任务准确率上都紧密匹配全精度Muon,同时将优化器状态内存减少了高达7.3倍。我们的代码可在https://github.com/YupengSu/MuonQ获取。

关键词

引用

@article{arxiv.2605.11396,
  title  = {MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization},
  author = {Yupeng Su and Ruijie Zhang and Ziyue Liu and Yequan Zhao and Zheng Zhang},
  journal= {arXiv preprint arXiv:2605.11396},
  year   = {2026}
}

备注

MuonQ enables stable 4-bit quantization of Muon's optimizer states by preserving directional fidelity through pre-quantization normalization, structural decomposition, and companding quantization