中文

魔鬼藏在条件数中:为何 GLU 结构优于非 GLU 结构?

机器学习 2026-05-26 v2 人工智能

摘要

门控线性单元(GLU)及其变体在现代开源大型语言模型架构中被广泛采用,并且始终优于其非门控版本,但这种优势的 underlying 原因仍不清楚。本文通过分析神经切浪核(NTK)范式下的两层网络来研究 GLU。我们的分析揭示,GLU 结构重新塑造了 NTK 谱,从而导致条件数更小且特征值的分布更紧凑。基于这一发现,我们进一步分析了所产生的训练动力学,展示了重塑谱如何导致 GLU 模型的更快收敛,包括在 GLU 和非 GLU 模型之间观察到的特征损失交叉现象。最后,我们经验性地观察到 GLU 在各种模型中(包括 ViT 和 GPT-2)对缩小泛化差距的影响有限,表明其主要优势在于加速优化而非缩小泛化差距。代码已公开:https://github.com/Zemdalk/GLU-NTK。

关键词

引用

@article{arxiv.2605.20749,
  title  = {The Devil is in the Condition Numbers: Why is GLU Better than non-GLU Structure?},
  author = {Xingyu Lyu and Qianqian Xu and Zhiyong Yang and Peisong Wen and Qingming Huang},
  journal= {arXiv preprint arXiv:2605.20749},
  year   = {2026}
}

备注

Accepted by ICML 2026