中文

更具表达力的前馈层:第一部分。标记自适应激活混合

机器学习 2026-05-27 v1 人工智能 机器学习

摘要

前馈网络 (FFN) 层在 Transformer-based 大型语言模型 (LLM) 的参数和非线性表达力中占据很大比例。尽管从 ReLU 和 GELU 到 gated 变体如 SwiGLU 的演进,但大多数 FFN 设计仍使用单一固定激活函数,对所有标记应用相同的非线性变换。在本工作中,我们提出 Mixture of Activations (MoA),一种标记自适应 FFN 设计,通过轻量输入依赖门控混合激活函数字典,同时共享相同的线性投影。作为输入独立的对应物,我们也引入 learnable activations (LA),为两种类型的 FFN(ReLU 类型和 SwiGLU 类型)形成激活函数的线性组合。理论上,我们在固定激活 FFN、LA 和 MoA 之间建立严格的有限宽度表达分离:LA 严格包含固定激活 FFN,而 MoA 严格包含 LA,额外的表达力源于输入依赖的非线性混合。经验上,我们通过在稠密和 MoE 语言模型上进行大量预训练实验,参数规模从 0.12B 到 2B,在不同 token 预算、优化器和学习率计划下评估 MoA。MoA 在终端损失上始终低于经过精调的基线,并表现出更有利的比例行为,同时在参数和计算开销方面几乎没有增加。这些结果表明,标记自适应激活混合是提高 LLM 中 FFN 表达力的简单且有效的机制。

关键词

引用

@article{arxiv.2605.26647,
  title  = {More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations},
  author = {Mingze Wang and Jinbo Wang and Yikuan Xia and Kai Shen and Shu Zhong},
  journal= {arXiv preprint arXiv:2605.26647},
  year   = {2026}
}

备注

31 pages