中文

用于人-物交互检测的空间解析与动态时间池化网络

计算机视觉与模式识别 2022-06-08 v1

摘要

人-物交互(HOI)识别的关键在于推断人与物体之间的关系。近来,图像的人-物交互(HOI)检测已取得显著进展。然而,视频 HOI 检测性能仍有提升空间。现有单阶段方法使用精心设计的端到端网络检测视频片段并直接预测交互,使模型学习及网络进一步优化更为复杂。本文提出空间解析与动态时间池化(SPDTP)网络,将整段视频作为以人和物体节点构成的时空图输入。与现有方法不同,我们所提网络通过显式空间解析预测交互与非交互配对之间的差异,再进行交互识别。此外,我们提出可学习且可微的动态时间模块(DTM),以强调视频关键帧并抑制冗余帧。实验结果表明,SPDTP 能更多关注活跃的人-物配对与有效关键帧。总体而言,我们在 CAD-120 数据集和 Something-Else 数据集上取得了当前最优(state-of-the-art)性能。

关键词

引用

@article{arxiv.2206.03061,
  title  = {Spatial Parsing and Dynamic Temporal Pooling networks for Human-Object Interaction detection},
  author = {Hongsheng Li and Guangming Zhu and Wu Zhen and Lan Ni and Peiyi Shen and Liang Zhang and Ning Wang and Cong Hua},
  journal= {arXiv preprint arXiv:2206.03061},
  year   = {2022}
}

备注

Accepted by IJCNN2022