中文

有效的以主体为中心的人-物交互检测

计算机视觉与模式识别 2022-04-04 v1

摘要

尽管人-物交互(HOI)检测近年来取得了巨大进展,但由于图像中多人多物之间发生的复杂交互,其仍具挑战性,这不可避免地导致歧义。现有多数方法要么以两阶段方式生成所有人-物对候选并依次通过裁剪的局部特征推断关系,要么以单阶段流程直接预测交互点。然而,两阶段或单阶段方法分别缺乏空间配置或推理步骤,限制了其在复杂场景中的性能。为避免此歧义,我们提出一种新颖的以主体为中心的框架。核心思想是:在推断交互时,1)获取由主体位置引导的整图非局部特征以建模主体与上下文的关系,然后 2)我们使用物体分支生成像素级交互区域预测,其中交互区域指物体中心区域。此外,我们还使用主体分支获取主体的交互预测,并提出一种基于中心点索引的新颖组合策略以生成最终 HOI 预测。得益于非局部特征的使用以及人-物组合策略的部分耦合特性,我们所提框架可更准确地检测 HOI,尤其针对复杂图像。大量实验结果表明,我们的方法在具有挑战性的 V-COCO 和 HICO-DET 基准上达到了最先进水平,且在多人与/或多物场景中更为鲁棒。

关键词

引用

@article{arxiv.2202.11998,
  title  = {Effective Actor-centric Human-object Interaction Detection},
  author = {Kunlun Xu and Zhimin Li and Zhijun Zhang and Leizhen Dong and Wenhui Xu and Luxin Yan and Sheng Zhong and Xu Zou},
  journal= {arXiv preprint arXiv:2202.11998},
  year   = {2022}
}

备注

11 pages