Rank-Aware Spectral Bounds on Attention Logits for Stable Low-Precision Training
机器学习
2026-02-24 v1 人工智能
摘要
变压器注意力得分是双线性形式,其最大模长支配着低精度训练中的溢出风险。我们推导了一种\emph{基于秩的浓度不等式}:当交互矩阵的秩为时,的尾概率衰减为,而非,其中为典型性参数。对于变压器注意力而言,,这导致比现代体系结构中基于秩无关的界限更紧约10-28倍。我们将此结果应用于FP8训练,推导了\emph{几何感知比例因子},其提供了无需观察激活值的原则性溢出保证。该方法通过隐式幂迭代计算从谱范数得到每层比例因子,包含一种避免键扩展的分组查询注意力公式,同时与融合注意力内核兼容。我们在GPT-2 XL至Llama-2-70B范围内的模型上测试,几何感知缩放消除了延迟缩放在瞬态场景中的溢出,同时在可比下游MMLU准确率方面取得相当的结果。
引用
@article{arxiv.2602.18851,
title = {Rank-Aware Spectral Bounds on Attention Logits for Stable Low-Precision Training},
author = {Seyed Morteza Emadi},
journal= {arXiv preprint arXiv:2602.18851},
year = {2026}
}
备注
17 pages, 3 figures