视频中异构概念的弱监督学习
计算机视觉与模式识别
2016-07-13 v1
摘要
伴随在线视频的典型文本描述是“弱”的:即它们提及视频中的主要概念,但未提及它们对应的时空位置。描述中的概念通常是异构的(例如物体、人物、动作)。也可以从描述中推断出这些概念的某些位置约束。本文的目标是提出印度自助餐厅过程(IBP)的一种推广,其能够(a)在集成框架中系统地整合异构概念,且(b)实施位置约束,用于视频中概念的有效分类与定位。最后,我们利用平均场变分近似对所述公式进行后验推断。在Casablanca和A2D数据集上的对比评估表明,所提方法显著优于其他最先进技术(SOTA):与最具竞争力的基线相比,Casablanca数据集上成对概念分类相对提升24%,A2D数据集上定位相对提升9%。
引用
@article{arxiv.1607.03240,
title = {Weakly Supervised Learning of Heterogeneous Concepts in Videos},
author = {Sohil Shah and Kuldeep Kulkarni and Arijit Biswas and Ankit Gandhi and Om Deshmukh and Larry Davis},
journal= {arXiv preprint arXiv:1607.03240},
year = {2016}
}
备注
To appear at ECCV 2016