中文

CBNet:一种用于目标检测的复合骨干网络架构

计算机视觉与模式识别 2022-11-23 v7

摘要

现代性能最优的目标检测器严重依赖于骨干网络,骨干网络的进展通过探索更有效的网络结构带来了持续的性能提升。本文提出一种新颖且灵活的骨干框架,即 CBNetV2,用于在预训练-微调范式下利用现有开源预训练骨干构建高性能检测器。具体而言,CBNetV2 架构将多个相同的骨干分组,并通过复合连接进行连接。具体地,它整合多个骨干网络的高层与低层特征,并逐步扩大感受野以更高效地进行目标检测。我们还提出了一种带辅助监督的更优训练策略用于基于 CBNet 的检测器。无需对复合骨干进行额外预训练,CBNetV2 可适配各类骨干(基于 CNN 与基于 Transformer)以及大多数主流检测器(单阶段与两阶段、基于锚框与无锚框)的头部设计。实验有力证明,相较于简单增加网络深度与宽度,CBNetV2 引入了一种更高效、有效且资源友好的方式来构建高性能骨干网络。特别地,我们的 Dual-Swin-L 在单模型单尺度测试协议下于 COCO test-dev 上取得 59.4% box AP 与 51.6% mask AP,显著优于 Swin-L 所取得的 SOTA 结果(57.7% box AP 与 50.2% mask AP),同时训练 schedule 缩减了 6×\times。采用多尺度测试,我们在不使用额外训练数据的情况下将当前最佳单模型结果推至 60.1% box AP 与 52.3% mask AP 的新纪录。代码见 https://github.com/VDIGPKU/CBNetV2。

关键词

引用

@article{arxiv.2107.00420,
  title  = {CBNet: A Composite Backbone Network Architecture for Object Detection},
  author = {Tingting Liang and Xiaojie Chu and Yudong Liu and Yongtao Wang and Zhi Tang and Wei Chu and Jingdong Chen and Haibin Ling},
  journal= {arXiv preprint arXiv:2107.00420},
  year   = {2022}
}

备注

IEEE Transactions on Image Processing (TIP) camera ready