中文

Nexus:Transformer 中的高阶注意力机制

计算与语言 2025-12-05 v2

摘要

Transformer已在多个领域取得显著成功,依赖自注意力机制来捕捉依赖关系。然而,标准的一阶注意力机制常受低秩瓶颈限制,难以在单层中捕捉复杂的多跳关系。在本文中,我们提出了Nexus,这是一种新型架构,通过递归框架来增强表示能力。不同于使用静态线性投影的常规方法,Nexus通过嵌套自注意力机制动态细化这些表示。具体而言,查询和键向量本身是来自内部注意力循环的输出,允许令牌在最终注意力计算之前聚合全局上下文并建模高阶相关性。我们在递归步骤之间实施参数高效的权重共享策略,确保增强的表达能力仅增加 O(1)\mathcal{O}(1) 参数。我们提供的理论分析表明,该方法打破了标准注意力的线性瓶颈。实验结果表明,Nexus 在多个基准测试中超越了标准 Transformer。

关键词

引用

@article{arxiv.2512.03377,
  title  = {Nexus: Higher-Order Attention Mechanisms in Transformers},
  author = {Hanting Chen and Chong Zhu and Kai Han and Yuchuan Tian and Yuchen Liang and Tianyu Guo and Xinghao Chen and Dacheng Tao and Yunhe Wang},
  journal= {arXiv preprint arXiv:2512.03377},
  year   = {2025}
}