中文

LipsFormer:将Lipschitz连续性引入视觉Transformer

计算机视觉与模式识别 2023-04-20 v1 人工智能 机器学习

摘要

我们提出一种称为LipsFormer的Lipschitz连续Transformer,从理论和经验上追求基于Transformer模型的训练稳定性。与先前通过学习率预热、层归一化、注意力公式和权重初始化来解决训练不稳定的实用技巧不同,我们表明Lipschitz连续性是确保训练稳定性的更本质属性。在LipsFormer中,我们将不稳定的Transformer组件模块替换为Lipschitz连续的对应模块:以CenterNorm替代LayerNorm,以谱初始化替代Xavier初始化,以缩放余弦相似度注意力替代点积注意力,以及加权残差捷径。我们证明这些引入的模块是Lipschitz连续的,并推导出LipsFormer的Lipschitz常数上界。我们的实验表明,LipsFormer允许深度Transformer架构的稳定训练,无需如预热般精细的学习率调节,从而实现更快收敛和更好泛化。结果,在ImageNet 1K数据集上,基于Swin Transformer的LipsFormer-Swin-Tiny训练300个epoch可在无任何学习率预热下取得82.7%。此外,基于CSwin的LipsFormer-CSwin-Tiny训练300个epoch以4.7G FLOPs和24M参数达到83.5%的top-1准确率。代码将于 \url{https://github.com/IDEA-Research/LipsFormer} 发布。

关键词

引用

@article{arxiv.2304.09856,
  title  = {LipsFormer: Introducing Lipschitz Continuity to Vision Transformers},
  author = {Xianbiao Qi and Jianan Wang and Yihao Chen and Yukai Shi and Lei Zhang},
  journal= {arXiv preprint arXiv:2304.09856},
  year   = {2023}
}

备注

To appear in ICLR 2023, our code will be public at https://github.com/IDEA-Research/LipsFormer