中文

变长 Transformer 中的长度泛化的定量界限

机器学习 2025-11-03 v1 机器学习

摘要

我们研究变长泛化 (LG) 在 transformer 中的问题:即在训练所用较短序列后,模型在评估时如何在 much longer、以前未见的输入上保持性能。Huang 等人 (2025) 的先前工作已确立一旦训练序列长度超过某个有限阈值,transformer 就会实现长度泛化,但留下了模型必须多大才能实现此目标的开放问题。本文提供了长度泛化所需训练长度的首个定量界限。受鼓舞于先前的实证和理论工作,我们在多个不同情境中分析 LG:\ell_\infty 误差控制 vs. 对输入分布的平均误差控制、无限精度 softmax 注意力 vs. 有限精度注意力(后者简化为 argmax)在 transformer 中,以及单层 vs. 双层 transformer。在所有情境下,我们证明只要 transformer 在较长序列上的内部行为可被其在训练期间看到的较短序列所“模拟”,即实现长度泛化。我们的界限给出变长训练数据所需长度的定性估计,并经验验证这些洞见。这些结果细化了理解 transformer 中外推机制的理论基础,形式化了更丰富训练数据有助于复杂任务泛化的直觉。

关键词

引用

@article{arxiv.2510.27015,
  title  = {Quantitative Bounds for Length Generalization in Transformers},
  author = {Zachary Izzo and Eshaan Nichani and Jason D. Lee},
  journal= {arXiv preprint arXiv:2510.27015},
  year   = {2025}
}

备注

Equal contribution, order determined by coin flip