中文

Transformer 长度泛化中的方差消失问题

机器学习 2025-04-04 v1 人工智能

摘要

众所周知,Transformer 在训练较短序列后,难以在测试时对更长序列实现稳健泛化。这引发了一个问题:Transformer 模型是否是真正的推理引擎,尽管它们在数学问题解决与代码合成方面展现了惊人的能力。本文从vanishing variance 的视角提供了新的解释。我们是首次证明,即便是当今前沿模型,在更长的序列长度下,多头注意力模块的输出方差也会降低。在 argmax 检索与字典查找任务上,我们实验表明,对注意力输出应用层归一化可显著提升长度泛化。我们的分析将这种改进归因于减少——但并非完全消除——由vanishing variance 引起的分布迁移。

关键词

引用

@article{arxiv.2504.02827,
  title  = {On Vanishing Variance in Transformer Length Generalization},
  author = {Ruining Li and Gabrijel Boduljak and Jensen and Zhou},
  journal= {arXiv preprint arXiv:2504.02827},
  year   = {2025}
}

备注

Project page: https://ruiningli.com/vanishing-variance. The first two authors contributed equally to this work