用于视觉识别的双流网络
计算机视觉与模式识别
2021-10-28 v4
摘要
具有卓越全局表征能力的 Transformer 在视觉任务上取得有竞争力的结果,但未能考虑输入图像中的高层局部模式信息。本文提出一种通用双流网络(DS-Net)以充分挖掘局部与全局模式特征在图像分类中的表征能力。我们的 DS-Net 能同时计算细粒度与整体特征并高效融合。具体而言,我们提出帧内尺度传播模块以在每个块中处理两种不同分辨率,以及跨尺度对齐模块以在双尺度特征间进行信息交互。此外,我们还设计了双流 FPN(DS-FPN)以进一步增强下游密集预测的上下文信息。不加额外技巧,所提 DS-Net 在 ImageNet-1k 上以 top-1 准确率超越 DeiT-Small 达 2.4%,并相对于其他 Vision Transformer 与 ResNet 取得最先进性能。在目标检测与实例分割上,DS-Net-Small 分别在 MSCOCO 2017 上以 mAP 超越 ResNet-50 达 6.4% 与 5.5%,并超越先前最先进方案,显著展示其作为视觉任务通用骨干的潜力。代码将很快发布。
引用
@article{arxiv.2105.14734,
title = {Dual-stream Network for Visual Recognition},
author = {Mingyuan Mao and Renrui Zhang and Honghui Zheng and Peng Gao and Teli Ma and Yan Peng and Errui Ding and Baochang Zhang and Shumin Han},
journal= {arXiv preprint arXiv:2105.14734},
year = {2021}
}
备注
Accepted by NeurIPS 2021