中文

预规范Transformer中的门控规范层移除与尺度锚定

机器学习 2026-05-21 v2 计算与语言

摘要

规范层是Transformer架构中的标准组件,但是否在训练与推理过程中全程必要其样本依赖计算尚不明确。本文发展了一种针对预规范Transformer的门控规范层移除方法,采用TaperNorm实现,从标准RMSNorm/LayerNorm开始,逐渐锐化为学习到的样本无关线性或仿射映射。一旦门控值减至零,锐化层中便不再计算样本统计,从而可将生成的映射折叠到相邻的线性投影中。实验表明,在测试的预训练与微调设置下,内部规范层可被锐化,且仅引起小幅验证集损失增加。我们的方法揭示了最终规范层的独特作用,即锚定前 logits表示的尺度。有了该锚定后,隐藏状态的径向变化不会直接导致损失降低;而去除锚定后,通过增加logits幅值可实现交叉熵损失的降低。固定目标尺度损失提供了明确的备用锚定,使我们在所测试的范围内实现了完全无规范层的消融。最终,在KV缓存的自回归解码基准测试中,锐化内部规范层可实现最高达1.14×1.14\times的吞吐量提升(显式尺度操作),折叠后提升至1.18×1.18\times

关键词

引用

@article{arxiv.2602.10408,
  title  = {Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers},
  author = {Andrei Kanavalau and Carmen Amo Alonso and Sanjay Lall},
  journal= {arXiv preprint arXiv:2602.10408},
  year   = {2026}
}