中文

视频中异构概念的弱监督学习

计算机视觉与模式识别 2016-07-13 v1

摘要

伴随在线视频的典型文本描述是“弱”的:即它们提及视频中的主要概念,但未提及它们对应的时空位置。描述中的概念通常是异构的(例如物体、人物、动作)。也可以从描述中推断出这些概念的某些位置约束。本文的目标是提出印度自助餐厅过程(IBP)的一种推广,其能够(a)在集成框架中系统地整合异构概念,且(b)实施位置约束,用于视频中概念的有效分类与定位。最后,我们利用平均场变分近似对所述公式进行后验推断。在Casablanca和A2D数据集上的对比评估表明,所提方法显著优于其他最先进技术(SOTA):与最具竞争力的基线相比,Casablanca数据集上成对概念分类相对提升24%,A2D数据集上定位相对提升9%。

关键词

引用

@article{arxiv.1607.03240,
  title  = {Weakly Supervised Learning of Heterogeneous Concepts in Videos},
  author = {Sohil Shah and Kuldeep Kulkarni and Arijit Biswas and Ankit Gandhi and Om Deshmukh and Larry Davis},
  journal= {arXiv preprint arXiv:1607.03240},
  year   = {2016}
}

备注

To appear at ECCV 2016