MoR:面向混合精度训练的表示混合
机器学习
2025-12-30 v1 人工智能
摘要
混合精度训练是扩展深度学习模型的关键技术,但成功的混合精度训练需要识别并应用正确的方法组合。本文介绍了我们关于表示混合的初步研究,这是一种新颖的、在逐张量和子张量级别的量化框架,能够动态分析张量的数值属性以在多种不同的表示之间进行选择。基于该框架,我们提出并实验了具体的算法,在逐张量和子张量级别的粒度上动态选择 FP8 和 BF16 表示。我们的通用方法旨在跨各种量化分区策略和数据集保持模型质量。我们的初步发现表明,该方法在 98.38% 的张量被量化为 FP8 格式的情况下,能够取得 state-of-the-art 的结果。这项工作突出了动态、属性感知的量化在保持模型质量方面的潜力。我们相信该方法通常可以提高低精度训练的鲁棒性,正如在没有细粒度分区的情况下实现与现有方法相当的 FP8 精度所证明的那样;或者该方法可以与其他训练方法结合使用,以提高对更低精度数字格式(如 NVFP4)的利用率。
引用
@article{arxiv.2512.22804,
title = {MoR: Mixture Of Representations For Mixed-Precision Training},
author = {Bor-Yiing Su and Peter Dykas and Mike Chrzanowski and Jatin Chhugani},
journal= {arXiv preprint arXiv:2512.22804},
year = {2025}
}