中文

变换CNN:用自注意力重铸预训练卷积层

机器学习 2021-06-11 v1

摘要

Vision Transformers(ViT)近来已成为卷积网络(CNNs)的有力替代方案。尽管混合模型试图弥合这两种架构之间的差距,但其依赖的自注意力层带来了严重的计算瓶颈,尤其在大空间分辨率下。本文中,我们探索通过将这些层初始化为卷积层来减少训练时间。这使我们能够从任意预训练CNN平滑过渡到其功能相同的混合模型,称为Transformed CNN(T-CNN)。仅经50轮微调,所得T-CNN相较CNN在ImageNet-1k上取得显著性能提升(ResNet50-RS的top-1提高+2.2%),且鲁棒性大幅改善(ImageNet-C上top-1提高+11%)。我们分析了T-CNN学习到的表征,从而更深入洞察卷积与自注意力之间富有成效的相互作用。最后,我们尝试从部分训练的CNN初始化T-CNN,发现其达到比从头训练的对应混合模型更优的性能,同时减少训练时间。

关键词

引用

@article{arxiv.2106.05795,
  title  = {Transformed CNNs: recasting pre-trained convolutional layers with self-attention},
  author = {Stéphane d'Ascoli and Levent Sagun and Giulio Biroli and Ari Morcos},
  journal= {arXiv preprint arXiv:2106.05795},
  year   = {2021}
}