仅编码器浅层 Transformer 的收敛性研究
机器学习
2023-11-06 v1
摘要
本文旨在从架构、初始化和有限宽度下的缩放等现实设定出发,建立仅编码器浅层 Transformer 的全局收敛理论。难点在于如何处理自注意力机制中的 softmax——Transformer 的核心成分。具体而言,我们诊断了缩放方案,仔细处理 softmax 的输入/输出,并证明在常用的 He/LeCun 初始化下,二次过参数化足以使我们的浅层 Transformer 实现全局收敛。此外,还给出了基于神经正切核(NTK)的分析,便于全面比较。我们的理论展示了对不同缩放方案和初始化重要性的区分。我们相信我们的结果能为更好理解现代 Transformer(尤其是训练动态)铺平道路。
引用
@article{arxiv.2311.01575,
title = {On the Convergence of Encoder-only Shallow Transformers},
author = {Yongtao Wu and Fanghui Liu and Grigorios G Chrysos and Volkan Cevher},
journal= {arXiv preprint arXiv:2311.01575},
year = {2023}
}