中文

巨型激活在 Transformer 训练中的隐藏动力学

人工智能 2026-02-25 v2

摘要

我们首次全面分析了 Transformer 训练期间巨型激活的发展,选取 Pythia 模型系列作为测试平台,并公开发布完整数据集以支持进一步研究。通过对各种模型规模和多个训练检查点进行系统性分析,我们证明巨型激活的出现遵循高度可预测的数学模式,可使用准指数调制对数函数精确建模,该函数包含五个关键参数。此外,我们开发了一个机器学习框架,从架构规格alone 预测这些数学参数,稳态行为准确率很高,对出现时机和规模的预测则具有中等准确率。这些发现使建构师能够通过设计选择预测和潜在控制巨型激活出现的关键方面,对模型稳定性、训练周期长度、可解释性和优化具有重大意义。我们的发现表明,巨型激活的出现由模型设计决定,并且可以在训练开始前预见,甚至可能被控制。代码已发布于 https://github.com/Aimpoint-Digital/massive-activations-fork。

关键词

引用

@article{arxiv.2508.03616,
  title  = {Hidden Dynamics of Massive Activations in Transformer Training},
  author = {Jorge Gallego-Feliciano and S. Aaron McClendon and Juan Morinelli and Stavros Zervoudakis and Antonios Saravanos},
  journal= {arXiv preprint arXiv:2508.03616},
  year   = {2026}
}