中文

稀疏性在 Transformer 长度泛化中的作用

机器学习 2025-02-25 v1 人工智能 计算与语言

摘要

训练大型语言模型以预测超出其训练上下文长度的内容近年来引起了广泛关注,但驱动这种长度泛化行为的原理仍有待深入探索。我们提出了一个新的理论框架来研究仅解码器 Transformer 所执行的下一词元预测任务的长度泛化。在概念上,我们证明了只要每个预测词元依赖于少量(固定)数量的先前词元,长度泛化就会发生。我们通过一个称为 kk-稀疏植入相关分布的概念对这些任务进行形式化,并表明能够泛化注意力头的 Transformer 理想化模型在此类任务上能成功实现长度泛化。作为额外收获,我们的理论模型为某些已引入以改善长度泛化的位置嵌入修改技术(如位置耦合)提供了理论依据。我们通过在合成任务和自然语言上的实验支持了我们的理论结果,这些结果证实了驱动长度泛化的一个关键因素是每个词元对先前词元的“稀疏”依赖结构。受我们的理论启发,我们引入了预测式位置耦合,该方法训练 Transformer 预测在位置耦合方法中所使用的位置 ID。预测式位置耦合由此使我们能够扩展位置耦合可成功应用以实现长度泛化的任务范围。

关键词

引用

@article{arxiv.2502.16792,
  title  = {The Role of Sparsity for Length Generalization in Transformers},
  author = {Noah Golowich and Samy Jelassi and David Brandfonbrener and Sham M. Kakade and Eran Malach},
  journal= {arXiv preprint arXiv:2502.16792},
  year   = {2025}
}