Transformer 长度泛化中的方差消失问题
机器学习
2025-04-04 v1 人工智能
摘要
众所周知,Transformer 在训练较短序列后,难以在测试时对更长序列实现稳健泛化。这引发了一个问题:Transformer 模型是否是真正的推理引擎,尽管它们在数学问题解决与代码合成方面展现了惊人的能力。本文从vanishing variance 的视角提供了新的解释。我们是首次证明,即便是当今前沿模型,在更长的序列长度下,多头注意力模块的输出方差也会降低。在 argmax 检索与字典查找任务上,我们实验表明,对注意力输出应用层归一化可显著提升长度泛化。我们的分析将这种改进归因于减少——但并非完全消除——由vanishing variance 引起的分布迁移。
关键词
引用
@article{arxiv.2504.02827,
title = {On Vanishing Variance in Transformer Length Generalization},
author = {Ruining Li and Gabrijel Boduljak and Jensen and Zhou},
journal= {arXiv preprint arXiv:2504.02827},
year = {2025}
}
备注
Project page: https://ruiningli.com/vanishing-variance. The first two authors contributed equally to this work