中文

SWAN-GPT:面向长上下文语言建模的高效可扩展方法

计算与语言 2025-04-14 v1

摘要

我们提出一种仅解码器的Transformer架构,能够稳健地推广到显著超过训练期间所见的序列长度。我们的模型SWAN-GPT交错地组合了无位置编码的层(NoPE)和配备旋转位置编码的滑动窗口注意力层(SWA-RoPE)。实验表明,在无需额外长上下文训练的情况下,模型在显著超过训练长度的序列上表现出色。通过动态缩放注意力得分实现推理中的鲁棒长度外推。此外,SWAN-GPT比标准GPT架构更高效,导致训练成本更低、吞吐量更高。进一步,我们展示了现有的预训练仅解码器模型可以efficient地转换为SWAN架构,只需最小化继续训练即可实现更长的上下文。总体而言,我们的工作为以有效且稳健的方式将语言模型扩展到更长的上下文提供了有效的方法。

关键词

引用

@article{arxiv.2504.08719,
  title  = {SWAN-GPT: An Efficient and Scalable Approach for Long-Context Language Modeling},
  author = {Krishna C. Puvvada and Faisal Ladhak and Santiago Akle Serrano and Cheng-Ping Hsieh and Shantanu Acharya and Somshubra Majumdar and Fei Jia and Samuel Kriman and Simeng Sun and Dima Rekesh and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2504.08719},
  year   = {2025}
}