中文

时空实例学习:基于类别监督的动作管提取

计算机视觉与模式识别 2018-11-26 v2

摘要

本工作的目标是在视频中进行时空动作定位,仅使用来自视频级类别标签的监督。当前最先进方法将这种弱监督动作定位范式视为多示例学习问题,其中示例是预先计算的时空候选。我们提出时空实例学习(Spatio-Temporal Instance Learning),使动作定位可直接从视频帧中的边界框候选进行,而非将时空学习从训练中割裂。我们阐明了模型的假设,并提出了最大间隔目标及带潜变量的优化方法,从而能够从视频标签进行动作的时空学习。我们还提供了一种高效的链接算法和两种重排序策略,以促进并进一步改进动作定位。在四个动作数据集上的实验评估证明了我们方法在弱监督定位中的有效性。此外,我们展示了如何融入其他监督层级与混合监督,作为确定动作定位最优监督策略的一步。

关键词

引用

@article{arxiv.1807.02800,
  title  = {Spatio-Temporal Instance Learning: Action Tubes from Class Supervision},
  author = {Pascal Mettes and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1807.02800},
  year   = {2018}
}