中文

面向人-物交互检测的深度上下文注意力机制

计算机视觉与模式识别 2019-10-18 v1

摘要

人-物交互检测是一类重要且相对新颖的视觉关系检测任务,对更深层次的场景理解至关重要。现有方法大多将问题分解为目标定位和交互识别。尽管取得了一定进展,但这些方法仅依赖人和物体的外观特征,忽略了可用的上下文信息,而上下文信息对于捕捉两者之间微妙的交互至关重要。我们提出了一种用于人-物交互检测的上下文注意力框架。该方法通过学习人和物体实例的上下文感知外观特征来利用上下文。所提出的注意力模块随后自适应地选择相关的以实例为中心的上下文信息,以突出可能包含人-物交互的图像区域。在三个基准数据集上进行了实验:V-COCO、HICO-DET 和 HCVRD。我们的方法在所有数据集上均优于当前最优技术。在 V-COCO 数据集上,与现有最佳方法相比,我们的方法在角色平均精度(mAProlemAP_{role})上取得了 4.4% 的相对提升。

关键词

引用

@article{arxiv.1910.07721,
  title  = {Deep Contextual Attention for Human-Object Interaction Detection},
  author = {Tiancai Wang and Rao Muhammad Anwer and Muhammad Haris Khan and Fahad Shahbaz Khan and Yanwei Pang and Ling Shao and Jorma Laaksonen},
  journal= {arXiv preprint arXiv:1910.07721},
  year   = {2019}
}

备注

Accepted at ICCV 2019