VSGNet:利用图卷积检测人与物体交互的空间注意力网络
计算机视觉与模式识别
2020-03-13 v1
摘要
全面的视觉理解需要能够在对物体单独分析的同时有效学习和利用物体交互的检测框架。这是人与物体交互(HOI)检测任务的主要目标。特别地,物体间的相对空间推理与结构连接是分析交互的关键线索,这正是所提出的视觉-空间-图网络(VSGNet)架构所解决的。VSGNet 从人与物体对中提取视觉特征,利用该对的空间配置精炼特征,并通过图卷积利用该对之间的结构连接。VSGNet 的性能使用 Verbs in COCO(V-COCO)和 HICO-DET 数据集进行了充分评估。实验结果表明,VSGNet 在 V-COCO 上优于最先进方法 8% 或 4 mAP,在 HICO-DET 上优于 16% 或 3 mAP。
引用
@article{arxiv.2003.05541,
title = {VSGNet: Spatial Attention Network for Detecting Human Object Interactions Using Graph Convolutions},
author = {Oytun Ulutan and A S M Iftekhar and B. S. Manjunath},
journal= {arXiv preprint arXiv:2003.05541},
year = {2020}
}
备注
Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2020)