中文

揭示 Transformer 的梯度下降动力学

机器学习 2024-11-13 v1 最优化与控制

摘要

虽然 Transformer 架构在各个领域取得了显著成功,但解释其优化动力学的详尽理论基础尚未完全建立。本研究旨在通过回答以下两个核心问题来弥补这一理解空白:(1) 哪些类型的 Transformer 架构允许梯度下降 (GD) 实现保证收敛?(2) 在什么初始条件和架构细节下,Transformer 在训练过程中能实现快速收敛?通过使用 Softmax 和高斯注意力核分析单层 Transformer 的损失景观,我们的工作为这些问题提供了具体答案。我们的发现表明,通过适当的权重初始化,梯度下降可以训练 Transformer 模型(无论使用哪种核类型)以达到全局最优解,特别是在输入嵌入维度较大时。尽管如此,某些场景凸显了潜在陷阱:使用 Softmax 注意力核训练 Transformer 有时会导致次优局部解。相比之下,高斯注意力核表现出更有利的行为。我们的实证研究进一步验证了理论发现。

关键词

引用

@article{arxiv.2411.07538,
  title  = {Unraveling the Gradient Descent Dynamics of Transformers},
  author = {Bingqing Song and Boran Han and Shuai Zhang and Jie Ding and Mingyi Hong},
  journal= {arXiv preprint arXiv:2411.07538},
  year   = {2024}
}