中文

标准化架构本质上是4位的

机器学习 2026-05-08 v1 人工智能

摘要

以4位精度训练大型语言模型对于效率至关重要。我们展示了nGPT——一种约束权重和隐藏表示落在单位球面上的架构——天然更耐低精度算术。这消除了应用随机Hadamard变换和执行按张量缩放计算等干预措施以维持模型质量的需求,从而实现稳定的端到端NVFP4训练。我们在12亿参数的稠密模型和最高达30亿参数的混合(Mamba-Transformer)MoE模型上进行验证。我们将这种鲁棒性归因于点积:虽然量化噪声在标准和标准化架构中基本不相关,但信号的行为不同。在nGPT中,单位球面约束增强了元素级乘积之间弱正相关性的积极性,导致信号在隐藏维度上发生建设性累积,而噪声继续平均消除。这产生更高的有效信噪比和更平坦的损失景观,随着隐藏维度增大,这种效果变得更加明显,表明在规模扩大的方面将具有日益增长的优势。参考实现已发布于https://github.com/anonymous452026/ngpt-nvfp4。

关键词

引用

@article{arxiv.2605.06067,
  title  = {Normalized Architectures are Natively 4-Bit},
  author = {Maxim Fishman and Brian Chmiel and Ron Banner and Daniel Soudry and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2605.06067},
  year   = {2026}
}