一种用于以不同监督程度训练动作定位的灵活模型
计算机视觉与模式识别
2018-11-29 v2
摘要
视频中的时空动作检测通常在全监督设置下处理,需要对训练视频逐帧进行人工标注。由于此类标注极为繁琐且阻碍可扩展性,明显需要最小化人工监督的量。本工作中我们提出一个统一框架,可处理并组合不同类型的较低要求的弱监督。我们的模型基于判别聚类,并将不同类型的监督作为优化上的约束进行集成。我们研究了该模型在具有替代监督信号的训练设置中的应用,范围从视频级类别标签到动作边界框的完整逐帧标注。在具有挑战性的 UCF101-24 和 DALY 数据集上的实验表明,我们的方法以先前方法所用监督的一小部分达到了有竞争力的性能。我们模型的灵活性支持从具有不同标注程度的数据联合学习。实验结果表明,向其他弱标注视频中加入少量全监督样本可带来显著增益。
引用
@article{arxiv.1806.11328,
title = {A flexible model for training action localization with varying levels of supervision},
author = {Guilhem Chéron and Jean-Baptiste Alayrac and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:1806.11328},
year = {2018}
}