中文

高效上下文传播Perceiver架构用于自回归语言建模

计算与语言 2026-02-24 v3 机器学习

摘要

Transformer 架构中注意力机制的二次复杂度是其高效处理长序列的关键挑战。许多近期研究尝试将注意力的 O(n2)O(n^2) 时间复杂度简化为准线性复杂度,但在降低复杂度的同时保持高性能仍是未解决的问题。Perceiver 类架构在降低计算复杂度的同时表现出色,这是该问题的重要工作之一。本文以 PerceiverAR 为基础,探讨了在保持上下文和降低注意力复杂度之间进行不同权衡的设计空间。为此,我们发展了四种新的架构范式,其中表现最佳者我们称为高效上下文传播Perceiver(ECP)。ECP 相比 PerceiverAR 有两个主要优势:首先,ECP 架构通过同时利用上下文序列和潜在序列来克服 PercieverAR 的主要缺点;其次,ECP 架构的注意力复杂度与 LongLoRA 相同,具有更好的计算效率。更重要的是,via 两两段落注意力,它提取更好的信息,实现了改进的语言建模。实验表明,ECP 架构在 Wikitext-103、PG-19 和 sCIFAR-10 上显著优于其他最先进的 Transformer 模型。

关键词

引用

@article{arxiv.2412.06106,
  title  = {Efficient Context Propagating Perceiver Architectures for Auto-Regressive Language Modeling},
  author = {Kaleel Mahmood and Shaoyi Huang},
  journal= {arXiv preprint arXiv:2412.06106},
  year   = {2026}
}