Transformer 中的数值脆弱性:用于解释、预测和缓解不稳定性的层级理论
机器学习
2025-10-28 v1 数值分析
数值分析
摘要
在低精度下训练的 Transformer 会遭受前向误差放大。我们给出一种一阶、模块化的理论,用于预测何时何处会放大误差。对于自注意力机制,我们推导出一个分解为三个可解释诊断因子的 per-layer 界限:一个得分尺度比 、行级 softmax 灵敏度 ,以及值条件 。我们证明了残差块可减缓深度累积的残差松弛不等式,并引入了一个受精度和宽度影响的 LayerNorm 指示器 ,并给出在 -主导 regime 中的匹配一阶界限。这些组件为统一的前向稳定性界限提供了解决方案,其右侧在训练期间可直接估计。在 Tiny-ViT/CIFAR-10 上我们评估了该界限和组件。(1)组合预测器 跟踪 FP32↔LP 之间的不匹配,跨随机种子、宽度和精度进行缩放;以 为尺度可消除混合精度点。(2) 的时间序列最大值作为早期警报信号,leading error spikes by 16-24 步(相关系数 0.65-0.82;排列 ;Precision@K 0.89-1.00)。(3)根据 ,对 进行小幅 LayerNorm- 调整可实现稳定(平均尾部损失 at , cap),开销极小。总体而言,我们的理论提供了可操作的、无量纲的诊断工具(i)解释何时自注意力脆弱,(ii)预测不稳定性,(iii)激发最小侵入性的缓解措施。
引用
@article{arxiv.2510.21770,
title = {Numerical Fragility in Transformers: A Layer-wise Theory for Explaining, Forecasting, and Mitigating Instability},
author = {Jinwoo Baek},
journal= {arXiv preprint arXiv:2510.21770},
year = {2025}
}
备注
15 pages