中文

ConTNet:为何不同时使用卷积与Transformer?

计算机视觉与模式识别 2021-05-12 v3

摘要

尽管卷积网络(ConvNets)在计算机视觉(CV)中取得巨大成功,其在捕获对目标检测与分割等密集预测任务至关重要的全局信息方面存在不足。本工作中,我们创新性地提出ConTNet(ConvolutionTransformer Network),将Transformer与ConvNet架构结合以提供大感受野。不同于近期提出的基于Transformer的模型(如ViT、DeiT)在中等规模数据集(如ImageNet1k)上从头训练时对超参数敏感且极度依赖大量数据增强,ConTNet可像常规ConvNets(如ResNet)一样优化并保持卓越鲁棒性。同样值得指出的是,在给定相同强数据增强时,ConTNet的性能提升比ResNet更为显著。我们在图像分类及下游任务上展示了其优越性与有效性。例如,我们的ConTNet在ImageNet上取得81.8%的top-1准确率,与DeiT-B相同且计算复杂度不到其40%。ConTNet-M作为Faster-RCNN(提升2.6%)与Mask-RCNN(提升3.2%)的主干网络在COCO2017数据集上也优于ResNet50。我们希望ConTNet能作为CV任务的有用主干并为模型设计带来新思路。

关键词

引用

@article{arxiv.2104.13497,
  title  = {ConTNet: Why not use convolution and transformer at the same time?},
  author = {Haotian Yan and Zhe Li and Weijian Li and Changhu Wang and Ming Wu and Chuang Zhang},
  journal= {arXiv preprint arXiv:2104.13497},
  year   = {2021}
}