中文

TagBook:用于事件检测的无监督语义视频表示

计算机视觉与模式识别 2016-04-26 v2 多媒体

摘要

我们考虑在仅有少量甚至零样例可用于训练的场景下的视频事件检测问题。针对这一具有挑战性的设定,文献中的主流解决方案依赖于从数千个预训练概念检测器中获得的语义视频表示。与现有工作不同,我们提出了一种仅基于免费可用的社交标记视频的新型语义视频表示,无需训练任何中间概念检测器。我们引入了一种简单的算法,该算法从视频的最近邻传播标签,其思想类似于图像检索中使用的算法,但通过包含视频源集细化和改变视频标签分配,将其重新设计用于视频事件检测。我们将我们的方法称为 TagBook,并在 TRECVID 2013 和 2014 多媒体事件检测数据集以及 Columbia Consumer Video 数据集上研究了其构造、描述性和检测性能。尽管其性质简单,所提出的 TagBook 视频表示在少样例和零样例事件检测中非常有效,甚至优于基于监督表示的最新 SOTA 替代方案。

关键词

引用

@article{arxiv.1510.02899,
  title  = {TagBook: A Semantic Video Representation without Supervision for Event Detection},
  author = {Masoud Mazloom and Xirong Li and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1510.02899},
  year   = {2016}
}

备注

accepted for publication as a regular paper in the IEEE Transactions on Multimedia