中文

Container:上下文聚合网络

计算机视觉与模式识别 2021-10-19 v2

摘要

卷积神经网络(CNN)在计算机视觉中无处不在,拥有大量有效且高效的变体。近来,最初引入于自然语言处理的Transformer正越来越多地被应用于计算机视觉。虽然早期采用者继续使用CNN骨干网络,但最新的网络是端到端无CNN的Transformer方案。一个近期令人惊讶的发现表明,一种不含任何传统卷积或Transformer组件、基于简单MLP的方案也能产生有效的视觉表征。尽管CNN、Transformer和MLP-Mixer可能被视为完全不同的架构,我们提供了一种统一视角,表明它们实际上是一个更通用方法的特例,该方法用于在神经网络栈中聚合空间上下文。我们提出\model(CONText AggregatIon NEtwoRk,上下文聚合网络),一种用于多头上下文聚合的通用构建模块,它能够像Transformer那样利用长程交互,同时仍利用局部卷积操作的归纳偏置,从而实现更快的收敛速度(这常见于CNN中)。与不能很好地扩展到依赖更大输入图像分辨率的下游任务的基于Transformer的方法不同,我们高效的网络(命名为\modellight)可用于目标检测和实例分割网络,如DETR、RetinaNet和Mask-RCNN,获得令人印象深刻的检测mAP 38.9、43.8、45.1以及掩码mAP 41.3,与计算和参数量相当的ResNet-50骨干网络相比,分别大幅提升了6.6、7.3、6.9和6.6个百分点。我们的方法在DINO框架下的自监督学习中也取得了相比DeiT有前景的结果。代码发布于\url{https://github.com/allenai/container}。

关键词

引用

@article{arxiv.2106.01401,
  title  = {Container: Context Aggregation Network},
  author = {Peng Gao and Jiasen Lu and Hongsheng Li and Roozbeh Mottaghi and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2106.01401},
  year   = {2021}
}

备注

NeuIPS 2021