基于文本记录的动作弱监督学习
计算机视觉与模式识别
2017-06-20 v2
摘要
我们提出了一种从视频转录文本中进行人体动作弱监督学习的方法。我们的系统基于这样一个思想:给定输入数据序列和一份转录文本(即视频中动作发生顺序的列表),可以推断出视频流中的动作,从而学习相关的动作模型,而无需任何基于帧的标注。从手头的转录信息出发,我们根据预期动作的数量对给定的数据序列进行均匀分割。然后,我们通过最大化训练视频序列由动作模型生成的概率(给定转录文本定义的序列顺序)来学习每个类别的动作模型。学习到的模型可用于对未见过的视频进行时间分割,无论是否提供转录文本。我们在四个不同的活动数据集上评估了我们的方法,即 Hollywood Extended、MPII Cooking、Breakfast 和 CRIM13。我们表明,我们的系统能够将脚本化的动作与视频数据对齐,并且学习到的模型在动作定位和分类方面,与使用完全监督(即帧级标注)训练的模型相比具有竞争力,并且优于当前任何最先进的将转录文本与视频数据对齐的方法。
引用
@article{arxiv.1610.02237,
title = {Weakly supervised learning of actions from transcripts},
author = {Hilde Kuehne and Alexander Richard and Juergen Gall},
journal= {arXiv preprint arXiv:1610.02237},
year = {2017}
}
备注
33 pages, 9 figures, to appear in CVIU