中文

关于语言建模中Transformer的跑道级联

机器学习 2026-01-22 v1

摘要

在仅解码器(因果)Transformer中,由因果掩码创建的计算图通过直接路径注意力和由中间token形成的间接路径路由信息。我们将token对之间的这些间接路径称为它们的跑道。我们认为,近期越来越多研究观察到的因果Transformer的某些失效模式,很可能因这两种信息传播模式之间的错位而加剧。我们将跑道级联形式化为一种现象,即这种错位导致冗余和不相关信息级联到token表示中,尽管注意力模式已得到充分学习。作为解决方案,我们提出跑道感知重连,作为一种更显式的方式,将跑道上下文直接纳入每个token的直接路径注意力中。该机制基于每个token的跑道景观摘要重新连接其注意力模式,使其能够感知累积的表征影响,并实现更平衡的信息传播。我们提出的方法不引入额外参数,并且可以无缝集成到标准注意力机制中。实验表明,与标准Transformer相比,我们的重连Transformer在通用语言建模以及明显更强的信息检索和外推能力方面均取得了稳步提升。

关键词

引用

@article{arxiv.2601.14522,
  title  = {On the Runway Cascade of Transformers for Language Modeling},
  author = {Hunjae Lee and Corey Clark},
  journal= {arXiv preprint arXiv:2601.14522},
  year   = {2026}
}