中文

Transformer 中的数值脆弱性:用于解释、预测和缓解不稳定性的层级理论

机器学习 2025-10-28 v1 数值分析 数值分析

摘要

在低精度下训练的 Transformer 会遭受前向误差放大。我们给出一种一阶、模块化的理论,用于预测何时何处会放大误差。对于自注意力机制,我们推导出一个分解为三个可解释诊断因子的 per-layer 界限:一个得分尺度比 κscore\kappa_{\rm score}、行级 softmax 灵敏度 κsoftmax\kappa_{\rm softmax},以及值条件 κ(V)\kappa(V)。我们证明了残差块可减缓深度累积的残差松弛不等式,并引入了一个受精度和宽度影响的 LayerNorm 指示器 ρLN\rho_{\rm LN},并给出在 ϵ\epsilon-主导 regime 中的匹配一阶界限。这些组件为统一的前向稳定性界限提供了解决方案,其右侧在训练期间可直接估计。在 Tiny-ViT/CIFAR-10 上我们评估了该界限和组件。(1)组合预测器 κsoftmax,(1+κscore),κ(V),WO2+κeff+CLN\kappa_{\rm softmax},(1+\kappa_{\rm score}),\kappa(V),|W_O|2+\kappa{\rm eff}+C_{\rm LN} 跟踪 FP32↔LP 之间的不匹配,跨随机种子、宽度和精度进行缩放;以 ϵmach\epsilon_{\rm mach} 为尺度可消除混合精度点。(2)κsoftmax\kappa_{\rm softmax} 的时间序列最大值作为早期警报信号,leading error spikes by 16-24 步(相关系数 0.65-0.82;排列 p!!103p!\approx!10^{-3};Precision@K 0.89-1.00)。(3)根据 ρLN\rho_{\rm LN},对 ρ\rho_\star 进行小幅 LayerNorm-ϵ\epsilon 调整可实现稳定(平均尾部损失  0.010\downarrow\ \approx0.010 at ρ!=!0.6\rho_\star!=!0.6, cap=102=10^{-2}),开销极小。总体而言,我们的理论提供了可操作的、无量纲的诊断工具(i)解释何时自注意力脆弱,(ii)预测不稳定性,(iii)激发最小侵入性的缓解措施。

关键词

引用

@article{arxiv.2510.21770,
  title  = {Numerical Fragility in Transformers: A Layer-wise Theory for Explaining, Forecasting, and Mitigating Instability},
  author = {Jinwoo Baek},
  journal= {arXiv preprint arXiv:2510.21770},
  year   = {2025}
}

备注

15 pages