中文

GID-Net:利用全局与实例依赖检测人与物体交互

计算机视觉与模式识别 2020-03-12 v1

摘要

由于检测和识别单独的人或物体不足以理解视觉世界,学习人类如何与周围物体交互成为一项核心技术。然而,卷积操作在刻画实例间视觉交互方面较弱,因为它们仅构建每次处理一个局部邻域的模块。为解决此问题,我们从人类观察 HOI(人与物体交互)的感知中学习,引入一种称为 GID 块的可训练两阶段推理机制。GID 块突破局部邻域,从场景中捕获像素在全局级和实例级的远程依赖,以帮助检测实例间交互。此外,我们构建了称为 GID-Net 的多流网络,这是一个由人分支、物体分支和交互分支组成的人与物体交互检测框架。全局级和局部级的语义信息在各分支中被高效推理与聚合。我们在两个公开基准(包括 V-COCO 和 HICO-DET)上将提出的 GID-Net 与现有最先进方法比较。结果表明 GID-Net 在上述两个基准上均优于现有最佳性能方法,验证了其在检测人与物体交互中的有效性。

关键词

引用

@article{arxiv.2003.05242,
  title  = {GID-Net: Detecting Human-Object Interaction with Global and Instance Dependency},
  author = {Dongming Yang and YueXian Zou and Jian Zhang and Ge Li},
  journal= {arXiv preprint arXiv:2003.05242},
  year   = {2020}
}

备注

30 pages, 8 figures