中文

稀疏性转移计算:FFN 架构如何重塑小型 Transformer 中的注意力

机器学习 2026-05-18 v2 人工智能 神经与进化计算

摘要

Transformer 前馈网络(FFN)模块内部的架构选择不仅影响该模块本身,还会重塑模型其余部分学习到的计算。我们在针对带进位加法、模运算和直方图计数的单层 Transformer 上研究了这一效应。通过比较稠密 FFN、门控线性单元(GLU)、混合专家和 MoE-GLU,我们发现稀疏 MoE 路由可以将计算从 FFN 转移到注意力上,其中对基于进位的加法产生的消融可见效应最强。我们将这种重新分配分解为每 token FFN 容量的减少和跨专家的稀疏划分。关键的是,冻结的随机路由几乎与学习到的路由相匹配,这表明这种重新分配很大程度上是由架构稀疏性驱动的,而非路由器学习到的专门化。作为次要发现,GLU 风格的乘法门控将与任务相关的傅里叶结构从每神经元基中旋转到分布式子空间中,使得神经元级别的可解释性信息量降低,同时保留了结构化计算。我们通过随机路由、窄 FFN 和 top-2 MoE 对照实验,以及参数匹配、激活函数和宽度扩展分析验证了这些结论。总而言之,这些结果表明,局部 FFN 设计选择可以对 Transformer 的计算产生非局部后果。

关键词

引用

@article{arxiv.2605.09403,
  title  = {Sparsity Moves Computation: How FFN Architecture Reshapes Attention in Small Transformers},
  author = {Gabriel Smithline and Chris Mascioli},
  journal= {arXiv preprint arXiv:2605.09403},
  year   = {2026}
}

备注

Preprint