中文

Transformer 中的损失景观简并与阶段性发展

机器学习 2025-08-04 v3 人工智能 计算与语言

摘要

深度学习涉及在神经网络参数空间的高维损失景观中导航。在训练过程中,神经网络内部形成并重新形成复杂的计算结构,导致输入/输出行为的转变。揭示支配神经网络结构和行为发展的原理是深度学习科学的优先事项。借鉴奇异学习理论的框架,我们提出模型的发展与损失景观局部几何中的简并深度相关。我们通过在整个训练过程中监测损失景观简并(由局部学习系数量化)来研究这种联系,对象包括一个 Transformer 语言模型和一个上下文线性回归 Transformer。我们表明,训练可以划分为损失景观简并发生变化的多个不同时期,并且这些简并的变化与 Transformer 的内部计算结构和输入/输出行为的重大变化相吻合。这一发现提供了简并与发展在 Transformer 中相互关联的启示性证据,突显了基于简并的视角在理解现代深度学习方面的潜力。

关键词

引用

@article{arxiv.2402.02364,
  title  = {Loss Landscape Degeneracy and Stagewise Development in Transformers},
  author = {Jesse Hoogland and George Wang and Matthew Farrugia-Roberts and Liam Carroll and Susan Wei and Daniel Murfet},
  journal= {arXiv preprint arXiv:2402.02364},
  year   = {2025}
}

备注

To appear, TMLR. Material on essential dynamics from v1 of this preprint has been removed and developed in arXiv:2501.17745