中文

InfiR2:面向推理增强语言模型的综合 FP8 训练方案

计算与语言 2025-10-20 v4 人工智能

摘要

训练大型语言模型(LLMs)的巨大计算成本构成了创新的主要障碍。尽管 FP8 训练以其显著的理论效率提升提供了一种有前景的解决方案,但由于缺乏全面的开源训练方案,其广泛采用受到了阻碍。为了弥补这一差距,我们引入了一种端到端的 FP8 训练方案,无缝集成了持续预训练和监督微调。我们的方法采用细粒度的混合粒度量化策略,以在最大化计算效率的同时保持数值保真度。通过大量实验,包括在 160B token 语料库上对模型进行持续预训练,我们证明了我们的方案不仅非常稳定,而且基本无损,在一系列推理基准上取得了与 BF16 基线相当的性能。至关重要的是,这是在显著的效率提升下实现的,包括训练时间减少高达 22%,峰值内存使用量减少 14%,以及吞吐量增加 19%。我们的结果确立了 FP8 作为 BF16 的一种实用且稳健的替代方案,我们将发布配套代码以进一步普及大规模模型训练。

关键词

引用

@article{arxiv.2509.22536,
  title  = {InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models},
  author = {Wenjun Wang and Shuo Cai and Congkai Xie and Mingfa Feng and Yiming Zhang and Zhen Li and Kejing Yang and Ming Li and Jiannong Cao and Hongxia Yang},
  journal= {arXiv preprint arXiv:2509.22536},
  year   = {2025}
}

备注

This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented