从凝聚到秩坍缩:Transformer 训练动力学的两阶段分析
机器学习
2025-10-09 v1
摘要
尽管基于 Transformer 的模型在经验上表现出卓越性能,但其训练动力学的基本原理除特定配置的研究外仍未得到充分刻画。受经验证据启发——语言模型在小初始化尺度下推理能力得到提升——我们采用 [Zhou et al. NeurIPS 2022] 中建立的梯度流分析框架,系统研究线性化 Transformer 的训练动力学。我们的理论分析将注意力模块的动力学分解为两个不同阶段。在第一阶段,来自随机初始化的非对称权重扰动维持参数矩阵中非退化的梯度动力学,促进系统性地从小初始化区域逃逸。随后,这些矩阵经历凝聚,逐步趋近目标方向。在第二阶段,先前静态的键-查询矩阵积极参与训练,驱动归一化矩阵渐近地走向秩坍缩。这一两阶段框架推广了经典的方向收敛结果。
引用
@article{arxiv.2510.06954,
title = {From Condensation to Rank Collapse: A Two-Stage Analysis of Transformer Training Dynamics},
author = {Zheng-An Chen and Tao Luo},
journal= {arXiv preprint arXiv:2510.06954},
year = {2025}
}