中文

ST-HOI:视频中人与物体交互检测的时空基线

计算机视觉与模式识别 2021-06-25 v2

摘要

检测人与物体交互(HOI)是机器实现全面视觉理解的重要一步。虽然从静态图像检测非时序HOI(如坐在椅子上)可行,但即便人类也难以从单视频帧推测时序相关HOI(如开门/关门),此时相邻帧起关键作用。然而,仅作用于静态图像的常规HOI方法一直被用于预测时序相关交互,这本质是在无时序上下文下猜测,可能导致次优性能。本文中,我们通过检测带显式时序信息的基于视频的HOI来弥补此差距。我们首先展示常见动作检测基线的朴素时序感知变体因特征不一致问题而无法用于基于视频的HOI。随后我们提出一种简洁而有效的架构,称为时空HOI检测(ST-HOI),利用人与物体轨迹、正确定位的视觉特征以及时空掩码姿态特征等时序信息。我们构建了名为VidHOI的新视频HOI基准,我们所提方法在该基准上作为坚实基线。

关键词

引用

@article{arxiv.2105.11731,
  title  = {ST-HOI: A Spatial-Temporal Baseline for Human-Object Interaction Detection in Videos},
  author = {Meng-Jiun Chiou and Chun-Yu Liao and Li-Wei Wang and Roger Zimmermann and Jiashi Feng},
  journal= {arXiv preprint arXiv:2105.11731},
  year   = {2021}
}

备注

Accepted at ACM ICMR'21 Workshop on Intelligent Cross-Data Analysis and Retrieval. The dataset and source code are available at https://github.com/coldmanck/VidHOI