中文

HoughNet:融合近距与远距证据用于视觉检测

计算机视觉与模式识别 2022-08-19 v2

摘要

本文提出 HoughNet,一种单阶段、无锚框、基于投票的自底向上目标检测方法。受广义 Hough 变换启发,HoughNet 通过投在某个位置上的投票总和来确定该位置是否存在物体。投票基于对数极坐标投票场从近距和远距位置收集。得益于该投票机制,HoughNet 能够融合近距和远距的类别条件证据用于视觉识别,从而推广并增强了当前通常仅依赖局部证据的目标检测方法。在 COCO 数据集上,HoughNet 的最佳模型取得了 46.446.4 APAP(以及 65.165.1 AP50AP_{50}),在与 SOTA 的自底向上目标检测性能相当的同时优于大多数主流单阶段和两阶段方法。我们进一步在其他视觉检测任务中验证了我们所提方法的有效性,即视频目标检测、实例分割、3D 目标检测、用于人体姿态估计的关键点检测,以及一个额外的“标签到照片”图像生成任务,其中我们投票模块的融合在所有情况下都持续提升性能。代码见 https://github.com/nerminsamet/houghnet。

关键词

引用

@article{arxiv.2104.06773,
  title  = {HoughNet: Integrating near and long-range evidence for visual detection},
  author = {Nermin Samet and Samet Hicsonmez and Emre Akbas},
  journal= {arXiv preprint arXiv:2104.06773},
  year   = {2022}
}

备注

accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2007.02355