中文

弱标记视频中的自动动作标注

计算机视觉与模式识别 2016-05-27 v1

摘要

视频中人体动作的手动时空标注费力,需要多名标注者且包含人类偏差。在本文中,我们提出了一种弱监督方法,用于自动获取动作视频中执行者的时空标注。我们首先在每视频中获得大量动作提议。为捕获每视频中少数最具代表性的动作提议并避免处理数千个提议,我们在基于3D-MRF的框架中使用光流和显著性对它们排序,并利用基于MAP的提议子集选择方法选取少数提议。我们证明该排序保留了高质量动作提议。针对同一动作的每视频生成若干此类提议。我们接下来的挑战是从每视频迭代地选择一个提议,使得所有提议全局一致。我们利用跨视频提议的形状、全局和细粒度相似性,将此表述为广义最大团图问题。我们方法的输出是每视频中最具动作代表性的提议。我们的方法还能标注视频中同一动作的多个实例。我们在三个具挑战性的动作数据集上验证了我们的方法:UCF Sport、sub-JHMDB和THUMOS'13,并与几种基线方法相比获得了有前景的结果。此外,在UCF Sports上,我们证明在这些自动获得的时空标注上训练的动作分类器与在真值标注上训练的分类器性能相当。

关键词

引用

@article{arxiv.1605.08125,
  title  = {Automatic Action Annotation in Weakly Labeled Videos},
  author = {Waqas Sultani and Mubarak Shah},
  journal= {arXiv preprint arXiv:1605.08125},
  year   = {2016}
}