Nexusformer:面向稳定且可继承 Transformer 扩展的非线性注意力扩张
机器学习
2026-04-22 v1 人工智能
摘要
扩展 Transformer 通常需要从头训练更大的模型,因为标准架构在不丢弃已学习表示的情况下难以进行扩展。我们发现其主要瓶颈在于注意力机制的线性投影,这些投影严格将特征提取限制在固定维度的子空间中,从而限制了表达能力与增量容量。为解决此问题,我们提出了 Nexusformer,它用 Nexus-Rank 层替换了线性 投影,该层是一个由在逐步升维空间中的双重激活驱动的三阶段非线性映射。这一设计克服了线性约束并实现了无损的结构化增长:可以通过零初始化块沿两个轴注入新容量,同时保留预训练知识。在语言建模和推理基准上的实验表明,在从 240M 到 440M 的渐进式扩展过程中,Nexusformer 在训练计算量减少高达 41.5% 的情况下,达到了与 Tokenformer 相同的困惑度。此外,我们对增长动力学的分析表明,零初始化诱导了稳定的收敛轨迹,使我们能够推导出一个几何缩放律,该定律能准确预测不同扩展尺度下的性能。
引用
@article{arxiv.2604.19147,
title = {Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling},
author = {Weijie Zhao and Mingquan Liu and Bolun Wang and Simo Wu and Nuobei Xie and Rui-Jie Zhu and Peng Zhou},
journal= {arXiv preprint arXiv:2604.19147},
year = {2026}
}