中文

点监督的动作定位

计算机视觉与模式识别 2018-10-02 v2

摘要

本文致力于视频中人体动作的时空定位。文献中的共识是,通过在每个训练视频的每一帧上提供的边界框标注进行训练来实现定位。由于视频中标注框昂贵、繁琐且易错,我们提出绕过框监督。相反,我们引入了基于点监督的动作定位。我们从无监督的时空候选出发,其提供视频中一组候选区域。虽然通常仅用于推断,我们表明时空候选在稀疏点标注引导的训练中也可被利用。我们引入了点与时空候选之间的重叠度量,并将它们全部纳入多示例学习优化的新目标中。在推断时,我们引入伪点——来自视频的视觉线索——自动引导时空候选的选择。我们概述了五个空间与一个时间伪点,以及一种在测试时最佳利用伪点的度量。在三个动作定位数据集上的实验评估表明,我们的点监督方法(i)以极小标注成本达到与传统框监督同等的效力,(ii)对稀疏与含噪点标注具有鲁棒性,(iii)在推断时受益于伪点,且(iv)优于近期弱监督替代方法。这使我们得出结论:点提供了框之外用于动作定位的可行替代。

关键词

引用

@article{arxiv.1805.11333,
  title  = {Pointly-Supervised Action Localization},
  author = {Pascal Mettes and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1805.11333},
  year   = {2018}
}

备注

International Journal of Computer Vision, 2018