中文

更细粒度更好(但需正确缩放)

机器学习 2026-05-12 v1

摘要

微缩放是保持量化到超低精度格式的大语言模型(LLM)质量的关键技术。直观上,更细的块大小应产生更低的量化误差;然而,文献中最近发现的一个悖论表明,标准的abs-max缩放实际上会随着块大小的缩小而降低模型质量。在这项工作中,我们研究了这一现象背后的内在机制。我们证明,这种退化并非更细粒度的固有限制,而主要是由重尾张量分布与FP4元素格式的粗上量化区间之间的不良交互引起的。具体来说,我们表明:i) 防止缩放因子下溢为零可减轻局部误差,ii) 有针对性的算法干预,如4-over-6方法,能有效纠正大元素的量化几何,iii) 暴力搜索建立了一个最优基线,证实理论上的均方误差(MSE)随着块大小的细化而严格改善。最终,我们的发现揭示了一种有价值的可互换性:应用正确的算法配方,允许标准的、硬件兼容的格式(如OCP E4M3)匹配定制的、更宽指数格式(如UE5M3)的性能。我们在多个大语言模型上验证了这些结果,完全解决了块大小悖论,并实现了稳健的下游困惑度改进。

关键词

引用

@article{arxiv.2605.08565,
  title  = {Finer is Better (with the Right Scaling)},
  author = {Clemens Schaefer and Gil Tabak},
  journal= {arXiv preprint arXiv:2605.08565},
  year   = {2026}
}