中文

你只需看单层特征

计算机视觉与模式识别 2021-03-18 v1

摘要

本文重新审视了用于单阶段检测器的特征金字塔网络 (FPN),并指出 FPN 的成功源于其针对目标检测中优化问题的分而治之解法,而非多尺度特征融合。从优化视角出发,我们引入了一种替代方法来解决该问题,而非采用复杂的特征金字塔——即仅利用单层特征进行检测。基于这一简单高效的方案,我们提出了你只需看单层特征 (YOLOF)。在我们的方法中,提出了两个关键组件,膨胀编码器 (Dilated Encoder) 和均匀匹配 (Uniform Matching),并带来了显著提升。在 COCO 基准上的大量实验证明了所提模型的有效性。我们的 YOLOF 取得了与其特征金字塔对应方法 RetinaNet 相当的结果,同时速度快 2.5×2.5\times。在没有 transformer 层的情况下,YOLOF 能以单层特征方式匹配 DETR 的性能,且训练轮数减少 7×7\times。在 608×608608\times608 图像尺寸下,YOLOF 在 2080Ti 上以 60 fps 运行达到 44.3 mAP,比 YOLOv4 快 13%13\%。代码见 \url{https://github.com/megvii-model/YOLOF}。

关键词

引用

@article{arxiv.2103.09460,
  title  = {You Only Look One-level Feature},
  author = {Qiang Chen and Yingming Wang and Tong Yang and Xiangyu Zhang and Jian Cheng and Jian Sun},
  journal= {arXiv preprint arXiv:2103.09460},
  year   = {2021}
}

备注

Accepted by CVPR2021. We provide more details and add additional comparison with YOLOv4 in this version