中文

ViTAS:视觉Transformer架构搜索

计算机视觉与模式识别 2021-12-01 v2 机器学习

摘要

视觉Transformer(ViT)继承了自然语言处理(NLP)的成功,但其结构尚未针对视觉任务得到充分研究与优化。最简单的方案之一是通过CNN中广泛使用的神经架构搜索(NAS)直接搜索最优结构。然而,我们通过实验发现这种直接适配会遇到灾难性失败,并使超网络(superformer)的训练极不稳定。本文认为,由于ViT主要在token嵌入上操作且归纳偏置很少,不同架构的通道不平衡会恶化权重共享假设,从而导致训练不稳定。因此,我们为ViT的token嵌入开发了一种新的循环权重共享机制,使每个通道能更均衡地贡献于所有候选架构。此外,我们还提出恒等偏移(identity shifting)以缓解超网络中的多对一问题,并经验性地利用弱增强与正则化技术实现更平稳的训练。基于此,我们提出的方法ViTAS在基于DeiT和Twins的ViT上均取得了显著优势。例如,在仅1.41.4G FLOPs预算下,我们搜索出的架构比基线DeiT在ImageNet-11k上准确率高出3.3%3.3\%。在3.03.0G FLOPs下,我们的结果在ImageNet-11k上达到82.0%82.0\%准确率,在COCO20172017上达到45.9%45.9\% mAP,比其他ViT高出2.4%2.4\%

关键词

引用

@article{arxiv.2106.13700,
  title  = {ViTAS: Vision Transformer Architecture Search},
  author = {Xiu Su and Shan You and Jiyang Xie and Mingkai Zheng and Fei Wang and Chen Qian and Changshui Zhang and Xiaogang Wang and Chang Xu},
  journal= {arXiv preprint arXiv:2106.13700},
  year   = {2021}
}