中文

内部场景相似性作为目标检测的上下文线索

计算机视觉与模式识别 2017-07-17 v1

摘要

利用图像上下文是改进目标检测的一种有效方法。先前提出的方法使用依赖于语义或空间信息的上下文线索。在本工作中,我们探索一种不同的上下文信息:内部场景相似性。我们提出 CISS(Context by Inner Scene Similarity)算法,其基于如下观察:两个视觉上相似的图像子块可能共享语义身份,尤其当它们同时出现在同一图像中时。CISS 使用基础检测器提供的基分数,并作为检测后阶段运行。对于每个候选子图像(记为 anchor),CISS 算法找到若干相似子图像(记为 supporters),并利用它们为 anchor 计算新的增强分数。这是通过利用 supporters 的基分数和预训练的依赖模型来实现的。新分数被建模为 anchor 与 supporters 基分数的线性函数,并通过最小均方误差优化进行估计。该方法带来:(a) 改进对部分遮挡物体的检测(当场景中存在相似未遮挡物体时),以及 (b) 更少的误报(当基础检测器错误地将背景块分类为物体时)。本工作关联于 Duncan 和 Humphreys 的“相似性理论”——一项心理物理学研究,其提出人类视觉系统感知性地分组相似图像区域,且一个区域的分类受另一区域估计身份的影响。实验结果展示了在 PASCAL VOC 数据集上基础检测器分数的提升。

关键词

引用

@article{arxiv.1707.04406,
  title  = {Inner-Scene Similarities as a Contextual Cue for Object Detection},
  author = {Noa Arbel and Tamar Avraham and Michael Lindenbaum},
  journal= {arXiv preprint arXiv:1707.04406},
  year   = {2017}
}