用于紧凑视频表示的局部聚合中心向量
多媒体
2015-09-15 v1 计算机视觉与模式识别
信息检索
摘要
我们提出一种用于紧凑视频表示的新型向量聚合技术,应用于大型视频数据集中的准确相似度检测。当前视觉搜索的最先进方法是由 Jegou 等人的局部聚合描述子向量(VLAD)构成。VLAD 基于尺度不变特征变换(SIFT)向量(逐帧提取)和在一训练集上计算的局部特征中心生成紧凑视频表示。为提高对视觉失真的鲁棒性,我们提出一种在特征表示更粗层级上操作的新方法。我们通过首先聚类 SIFT 特征获得局部特征中心(LFCs),然后针对从训练集提取的给定局部特征中心中心(CLFCs)对后者编码,创建局部聚合中心向量(VLAC)。LFCs 与 CLFCs 的差之和被聚合以生成用于准确视频段相似度检测的极紧凑视频描述。使用包含来自 Open Video Project 超过 1000 分钟内容的视频数据集的实验表明,在相同压缩因子和相同失真集下,VLAC 相对于 VLAD 和 Douze 等人的超池化方法在平均精度均值(mAP)方面获得显著增益。
引用
@article{arxiv.1509.03844,
title = {Vectors of Locally Aggregated Centers for Compact Video Representation},
author = {Alhabib Abbas and Nikos Deligiannis and Yiannis Andreopoulos},
journal= {arXiv preprint arXiv:1509.03844},
year = {2015}
}
备注
Proc. IEEE International Conference on Multimedia and Expo, ICME 2015, Torino, Italy