中文

基于文本记录的动作弱监督学习

计算机视觉与模式识别 2017-06-20 v2

摘要

我们提出了一种从视频转录文本中进行人体动作弱监督学习的方法。我们的系统基于这样一个思想:给定输入数据序列和一份转录文本(即视频中动作发生顺序的列表),可以推断出视频流中的动作,从而学习相关的动作模型,而无需任何基于帧的标注。从手头的转录信息出发,我们根据预期动作的数量对给定的数据序列进行均匀分割。然后,我们通过最大化训练视频序列由动作模型生成的概率(给定转录文本定义的序列顺序)来学习每个类别的动作模型。学习到的模型可用于对未见过的视频进行时间分割,无论是否提供转录文本。我们在四个不同的活动数据集上评估了我们的方法,即 Hollywood Extended、MPII Cooking、Breakfast 和 CRIM13。我们表明,我们的系统能够将脚本化的动作与视频数据对齐,并且学习到的模型在动作定位和分类方面,与使用完全监督(即帧级标注)训练的模型相比具有竞争力,并且优于当前任何最先进的将转录文本与视频数据对齐的方法。

关键词

引用

@article{arxiv.1610.02237,
  title  = {Weakly supervised learning of actions from transcripts},
  author = {Hilde Kuehne and Alexander Richard and Juergen Gall},
  journal= {arXiv preprint arXiv:1610.02237},
  year   = {2017}
}

备注

33 pages, 9 figures, to appear in CVIU