中文

RelationNet++:通过 Transformer 解码器桥接视觉表示以用于目标检测

计算机视觉与模式识别 2020-10-30 v1

摘要

现有的目标检测框架通常建立在单一格式的目标/部件表示之上,即 RetinaNet 与 Faster R-CNN 中的锚框/提议矩形框、FCOS 与 RepPoints 中的中心点,以及 CornerNet 中的角点。尽管这些不同表示通常驱使框架在不同方面表现良好(例如更好的分类或更精细的定位),但由于不同表示带来的异构或非网格特征提取,一般难以在单一框架中组合这些表示以充分利用各自优势。本文提出一个基于注意力的解码器模块,类似于 Transformer~\cite{vaswani2017attention} 中的解码器,以端到端方式将其他表示桥接到基于单一表示格式构建的典型目标检测器中。其他表示充当一组\emph{键}(key)实例,用以增强原始检测器中主\emph{查询}(query)表示特征。为高效计算该解码器模块,提出了新技术,包括\emph{键采样}方法与\emph{共享位置嵌入}方法。所提模块命名为\emph{桥接视觉表示}(BVR)。它可就地执行,我们展示了其在将其他表示桥接入主流目标检测框架(包括 RetinaNet、Faster R-CNN、FCOS 与 ATSS)中的广泛有效性,其中取得了约 1.53.01.5\sim3.0 AP 的提升。特别地,我们将一个具有强骨干网络的最先进框架提升了约 2.02.0 AP,在 COCO test-dev 上达到 52.752.7 AP。所得网络命名为 RelationNet++。代码将发布于 https://github.com/microsoft/RelationNet2。

关键词

引用

@article{arxiv.2010.15831,
  title  = {RelationNet++: Bridging Visual Representations for Object Detection via Transformer Decoder},
  author = {Cheng Chi and Fangyun Wei and Han Hu},
  journal= {arXiv preprint arXiv:2010.15831},
  year   = {2020}
}

备注

NeurIPS2020 Spotlight