中文

基于对比时空区域的视频弱监督人-物交互检测

计算机视觉与模式识别 2021-10-08 v1

摘要

我们引入了用于视频中人与物体交互检测的弱监督学习任务。我们的任务带来了独特的挑战,因为系统不知道视频中存在何种类型的人-物交互,也不知道人与物体的实际时空位置。为应对这些挑战,我们引入了一种对比弱监督训练损失,旨在将视频中的时空区域与动作和物体词表联合关联,并鼓励运动物体视觉外观的时间连续性作为一种自监督形式。为训练我们的模型,我们引入了一个包含超过 6.5k 个带人-物交互标注的视频的数据集,这些标注由与视频相关联的句子描述半自动整理得到。我们在我们的视频数据集上展示了相较适配于该任务的弱监督基线的性能提升。

关键词

引用

@article{arxiv.2110.03562,
  title  = {Weakly Supervised Human-Object Interaction Detection in Video via Contrastive Spatiotemporal Regions},
  author = {Shuang Li and Yilun Du and Antonio Torralba and Josef Sivic and Bryan Russell},
  journal= {arXiv preprint arXiv:2110.03562},
  year   = {2021}
}