VRFP:利用网络图像与快速Fisher向量乘积的即时视频检索
计算机视觉与模式识别
2017-04-11 v3
摘要
VRFP 是一个基于短文本输入查询的实时视频检索框架,它在查询已知后从网络上获取弱标注训练图像。代表该查询及每个数据库视频的检索网络图像被视为无序图像集合,且每个集合使用基于 CNN 特征的单一 Fisher Vector 表示。我们的实验表明,Fisher Vector 对网络图像中存在的噪声具有鲁棒性,并且在准确率上优于其他标准表示。尽管 Fisher Vector 可针对新查询高效构建,但由于其高维性,与测试集的匹配很慢。为实现实时匹配,我们提出了一种无损算法,加速高维 Fisher Vector 之间的内积计算。我们证明所需乘法的期望数量随 Fisher Vector 的稀疏性呈二次方下降。我们不仅能够实时构建和应用查询模型,而且借助简单的重排序方案,在 TRECVID MED13 (3.5%)、MED14 (1.3%) 和 CCV 数据集 (5.2%) 上以显著优势优于最先进的自动检索方法。我们还提供了两种不同自动视频检索范式——零样本学习与即时检索——在标准数据集上的直接比较。
引用
@article{arxiv.1512.03384,
title = {VRFP: On-the-fly Video Retrieval using Web Images and Fast Fisher Vector Products},
author = {Xintong Han and Bharat Singh and Vlad I. Morariu and Larry S. Davis},
journal= {arXiv preprint arXiv:1512.03384},
year = {2017}
}