中文

ConsNet:为零样本人-物交互检测学习一致性图

计算机视觉与模式识别 2022-03-29 v4

摘要

我们研究人-物交互(HOI)检测问题,旨在以图像中 <人, 动作, 物体> 的形式定位并识别 HOI 实例。大多数现有工作将 HOI 视为独立的交互类别,因而无法处理动作标签的长尾分布与一词多义问题。我们认为,物体、动作与交互之间的多级一致性是生成稀有或前所未见 HOI 语义表示的强线索。利用 HOI 标签的组合与关系特性,我们提出 ConsNet,一种知识感知框架,将物体、动作与交互间的关系显式编码为称为一致性图的无向图,并利用图注意力网络(GATs)在 HOI 类别及其组成部分间传播知识。我们的模型以候选人-物对的视觉特征与 HOI 标签的词嵌入为输入,将其映射至视觉-语义联合嵌入空间,并通过度量相似性获得检测结果。我们在具挑战性的 V-COCO 与 HICO-DET 数据集上广泛评估模型,结果验证了我们的方法在全监督与零样本设定下均优于当前最优方法。代码见 https://github.com/yeliudev/ConsNet。

关键词

引用

@article{arxiv.2008.06254,
  title  = {ConsNet: Learning Consistency Graph for Zero-Shot Human-Object Interaction Detection},
  author = {Ye Liu and Junsong Yuan and Chang Wen Chen},
  journal= {arXiv preprint arXiv:2008.06254},
  year   = {2022}
}

备注

Accepted to Proceedings of the 28th ACM International Conference on Multimedia (MM 2020)