中文

仅编码器浅层 Transformer 的收敛性研究

机器学习 2023-11-06 v1

摘要

本文旨在从架构、初始化和有限宽度下的缩放等现实设定出发,建立仅编码器浅层 Transformer 的全局收敛理论。难点在于如何处理自注意力机制中的 softmax——Transformer 的核心成分。具体而言,我们诊断了缩放方案,仔细处理 softmax 的输入/输出,并证明在常用的 He/LeCun 初始化下,二次过参数化足以使我们的浅层 Transformer 实现全局收敛。此外,还给出了基于神经正切核(NTK)的分析,便于全面比较。我们的理论展示了对不同缩放方案和初始化重要性的区分。我们相信我们的结果能为更好理解现代 Transformer(尤其是训练动态)铺平道路。

关键词

引用

@article{arxiv.2311.01575,
  title  = {On the Convergence of Encoder-only Shallow Transformers},
  author = {Yongtao Wu and Fanghui Liu and Grigorios G Chrysos and Volkan Cevher},
  journal= {arXiv preprint arXiv:2311.01575},
  year   = {2023}
}