中文

用于人-物交互检测的视觉-语义图注意力网络

机器学习 2021-03-09 v6 计算机视觉与模式识别 图像与视频处理

摘要

在场景理解中,机器人不仅受益于检测单个场景实例,还受益于学习它们可能的交互。人-物交互(HOI)检测在 <人, 谓词, 物> 三元组上推断动作谓词。上下文信息在推断交互中被发现至关重要。然而,大多数工作仅使用来自单个人-物对的局部特征进行推断。少数工作研究了通过图网络提供的附属关系的消歧贡献。类似地,少数工作学会了有效地利用视觉线索以及 HOI 中包含的固有语义规律性。我们提出了一种双图注意力网络,它通过注意力机制从主要人-物关系以及附属关系动态聚合上下文视觉、空间和语义信息,以获得强大的消歧能力。我们在两个基准测试 V-COCO 和 HICO-DET 上取得了可比的结果。代码可在 \url{https://github.com/birlrobotics/vs-gats} 获取。

关键词

引用

@article{arxiv.2001.02302,
  title  = {Visual-Semantic Graph Attention Networks for Human-Object Interaction Detection},
  author = {Zhijun Liang and Juan Rojas and Junfa Liu and Yisheng Guan},
  journal= {arXiv preprint arXiv:2001.02302},
  year   = {2021}
}

备注

7 pages, 4 figures, 3 tables