ViTAS:视觉Transformer架构搜索
计算机视觉与模式识别
2021-12-01 v2 机器学习
摘要
视觉Transformer(ViT)继承了自然语言处理(NLP)的成功,但其结构尚未针对视觉任务得到充分研究与优化。最简单的方案之一是通过CNN中广泛使用的神经架构搜索(NAS)直接搜索最优结构。然而,我们通过实验发现这种直接适配会遇到灾难性失败,并使超网络(superformer)的训练极不稳定。本文认为,由于ViT主要在token嵌入上操作且归纳偏置很少,不同架构的通道不平衡会恶化权重共享假设,从而导致训练不稳定。因此,我们为ViT的token嵌入开发了一种新的循环权重共享机制,使每个通道能更均衡地贡献于所有候选架构。此外,我们还提出恒等偏移(identity shifting)以缓解超网络中的多对一问题,并经验性地利用弱增强与正则化技术实现更平稳的训练。基于此,我们提出的方法ViTAS在基于DeiT和Twins的ViT上均取得了显著优势。例如,在仅G FLOPs预算下,我们搜索出的架构比基线DeiT在ImageNet-k上准确率高出。在G FLOPs下,我们的结果在ImageNet-k上达到准确率,在COCO上达到 mAP,比其他ViT高出。
引用
@article{arxiv.2106.13700,
title = {ViTAS: Vision Transformer Architecture Search},
author = {Xiu Su and Shan You and Jiyang Xie and Mingkai Zheng and Fei Wang and Chen Qian and Changshui Zhang and Xiaogang Wang and Chang Xu},
journal= {arXiv preprint arXiv:2106.13700},
year = {2021}
}