中文

利用框注意力检测视觉关系

计算机视觉与模式识别 2019-05-03 v2

摘要

我们提出一种用于检测视觉关系(如“人骑摩托车”或“瓶子在桌上”)的新模型。该任务是实现全面结构化图像理解的重要一步,超越了仅检测单个物体的范畴。我们的主要创新是一种框注意力(Box Attention)机制,可利用标准目标检测流程对物体间的两两交互进行建模。所得模型在概念上简洁、具表达力,并依赖于合理可靠的训练与预测流程。此外,与以往提出的方法不同,我们的模型并未在底层检测模型所必需的组件或超参数之上引入任何额外的复杂组件或超参数。我们在三个具有挑战性的数据集 V-COCO、Visual Relationships 和 Open Images 上进行了实验评估,展示了强劲的定量与定性结果。

关键词

引用

@article{arxiv.1807.02136,
  title  = {Detecting Visual Relationships Using Box Attention},
  author = {Alexander Kolesnikov and Alina Kuznetsova and Christoph H. Lampert and Vittorio Ferrari},
  journal= {arXiv preprint arXiv:1807.02136},
  year   = {2019}
}