中文

削减 Transformer MLP 预算:衡量与重新分配非线性

机器学习 2026-03-10 v2 计算与语言

摘要

我们研究何时实际需要 Transformer MLP 非线性。在 d+1 参数的门控器中决定是否用线性 surrogate 替代完整的 MLP。通过在六个模型(1.62 亿至28 亿参数)、两种架构和三个语料库上的系统性研究,我们确立非线性需求无法从 token 身份预测:跨语料的相关性为零(r<0.05r < 0.05)。路由决策完全基于上下文。尽管单实例的可预测性较弱,门控器仍利用高度不平衡的分布,其中大多数 MLP 计算接近线性,在不超过1%的 perplexity 成本下实现 25-56% 的线性路由。在 GPT-2 Large 中,11个36层中的层优于基线,唯一的层未超过3.7%全线性成本。这种成功取决于架构:Pythia 模型的成本更高,尽管 Pythia-2.8B 的完整 32 层扫描显示有一个层在狭窄情况下优于基线。在概念证明方面,我们逐步用冻结的线性矩阵替换中间层的 MLP:5个24层中的层可实现线性化且成本为零。在充足的训练预算下,4个线性化层可实现10.2%的 perplexity 改进——而采用两阶段门控方法可将其提升至17.3%,超越 vanilla fine-tuning 对照,确认这些层的非线性 MLP 在这些层上实际上是有害的。

关键词

引用

@article{arxiv.2603.03459,
  title  = {Half the Nonlinearity Is Wasted: Measuring and Reallocating the Transformer's MLP Budget},
  author = {Peter Balogh},
  journal= {arXiv preprint arXiv:2603.03459},
  year   = {2026}
}