关于两层 Transformer 的符号梯度下降优化与泛化性分析
机器学习
2025-03-04 v2 机器学习
摘要
Adam 是实际应用中用于 Transformer 优化的主流优化器,其复杂性使得理论上理解其优化机制具有重要意义。然而,由于 Adam 的复杂度,如何从理论上分析其对 Transformer 的优化仍具有挑战性。值得注意的是,Sign Gradient Descent (SignGD) 作为 Adam 的有效替代方案,尽管简单高效,但仍缺乏对其如何优化 Transformer 的理论理解。本文我们研究 SignGD 如何在线性可分噪声数据集上优化由softmax注意力层(带可训练查询-键参数化)和线性层构成的两层 Transformer。我们识别了训练动力学中的四个阶段,每个阶段都表现出有趣的行为。基于训练动力学,我们证明了在噪声数据集上所学习的 Transformer 具有快速收敛但较差泛化特性。我们还表明,Adam 在本设置下的优化与泛化行为与 SignGD 相似。此外,我们发现 SignGD 的差异化并非仅由数据噪声导致,这表明 SignGD 与 Adam 在实际任务中都需要高质量数据。最后,我们在合成数据和真实数据集上的实验结果支持了我们的理论结论。
关键词
引用
@article{arxiv.2410.04870,
title = {On the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent},
author = {Bingrui Li and Wei Huang and Andi Han and Zhanpeng Zhou and Taiji Suzuki and Jun Zhu and Jianfei Chen},
journal= {arXiv preprint arXiv:2410.04870},
year = {2025}
}
备注
79 pages, 19 figures, ICLR 2025 Spotlight