VideoStory 嵌入在样本稀少时识别事件
计算机视觉与模式识别
2015-11-10 v1 多媒体
摘要
本文旨在处理视频样本稀少甚至完全缺失时的事件识别问题。此种极具挑战性的设置中的关键在于语义视频表示。我们提出不从单独的属性检测器及其标注构建表示,而是利用视频特征与词向量之间的嵌入,从免费可用的网络视频及其描述中学习整体表示。在我们提出的称为 VideoStory 的嵌入中,词项之间的相关性被用于通过优化平衡描述性与可预测性的联合目标来学习更有效的表示。我们展示了使用包含外观、运动和音频特征的多模态可预测性损失学习 VideoStory 如何产生更具可预测性的表示。我们还提出了 VideoStory 的一种变体,通过引入词敏感描述性损失,仅从文本查询中的重要词项识别视频中的事件。我们在来自 NIST TRECVID 多媒体事件检测和 Columbia Consumer Videos 数据集的三个具有挑战性的网络视频集合上的实验表明:i) VideoStory 相对于使用属性或替代嵌入的表示的优势,ii) 通过嵌入融合视频模态相对于常见策略的益处,iii) 词敏感描述性与多模态可预测性对于无样本事件识别的互补性。凭借其在任何底层视频特征上提升可预测性同时最大化语义描述性的能力,VideoStory 在视频事件的少样本和零样本识别中均达到了最先进的精度。
引用
@article{arxiv.1511.02492,
title = {VideoStory Embeddings Recognize Events when Examples are Scarce},
author = {Amirhossein Habibian and Thomas Mensink and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:1511.02492},
year = {2015}
}