中文

从视频标签与伪标注中定位动作

计算机视觉与模式识别 2017-12-14 v1

摘要

本文的目标是确定视频中动作的时空位置。在难以获取边界框标注作为训练常态的情况下,本文提出了一种直观且有效的算法,仅从动作的类别标签对其进行定位。本文受到近期工作的启发,该工作表明利用人类点监督选择的无监督动作提案,其表现与使用昂贵的边界框标注一样好。本文不要求用户提供点监督,而是提出了完全自动化的视觉线索来替代手动点标注。本文将这些线索称为伪标注,引入了五种伪标注,并提出了一种相关性度量用于自动选择和组合它们。在具有挑战性的动作定位数据集上的全面评估表明,本文达到了与使用完整边界框监督相当的结果。本文还表明,在测试期间可以利用伪标注来改进弱监督和强监督定位器。

关键词

引用

@article{arxiv.1707.09143,
  title  = {Localizing Actions from Video Labels and Pseudo-Annotations},
  author = {Pascal Mettes and Cees G. M. Snoek and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1707.09143},
  year   = {2017}
}

备注

BMVC