中文

解构 LLM 强化学习中的 MXFP4 量化误差:可还原的死区、可消除的偏差与不可消除的底部噪声

机器学习 2026-05-25 v2 人工智能

摘要

MXFP4 算术可显著加速大型语言模型(LLM)的强化学习后训练,但量化误差会导致严重的精度下降。现有研究将量化误差视为单一噪声项,未能准确把握量化误差如何损害训练的具体机制。我们证明了量化误差的精确三分解,并展示了每种组成部分如何支配不同强化学习训练路径。我们的理论与实证分析将 MXFP4 量化误差分解为三个可加性组成部分:来自二进制取整的"比例偏差"(scale bias)、来自零化小值的"死区截断"(deadzone truncation),以及来自四位网格取整的"网格噪声"(grid noise)。每种组成部分支配不同的强化学习失败模式:比例偏差通过反向传播过程累积,影响梯度精度;死区截断降低 rollout 质量;网格噪声增加策略熵。我们提出了针对性修正措施:宏块缩放(macro-block scaling)以减少比例偏差,异常回退(Outlier Fallback)恢复死区条目,同时部分减少比例偏差引起的误差,以及自适应量化噪声(Adaptive Quantization Noise, AQN)用于控制策略熵。在Qwen2.5-3B稠密模型和Qwen3-30B-A3B-Base混合专家模型上,这些针对性修正使BF16精度恢复到0.7%以内,并超过BF16 +1.0%。

关键词

引用

@article{arxiv.2605.20402,
  title  = {Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor},
  author = {Xiaocan Li and Shiliang Wu and Zheng Shen},
  journal= {arXiv preprint arXiv:2605.20402},
  year   = {2026}
}