用于事件检索与识别的计数网格聚合
计算机视觉与模式识别
2016-10-12 v3
摘要
在大型视频语料库中进行事件检索与识别,需要在视频片段层面上一种整体固定尺寸的可视化表示,该表示应全面、紧凑且具区分性。它应综合聚合相关视频帧中的信息,同时抑制冗余信息,从而形成能够有效区分不同视觉事件的紧凑表示。为寻求此种表示,我们提出构建空间一致的计数网格模型,以聚合从不同的视频帧提取的深度特征。计数网格模型的空间一致性通过引入从大型视频数据语料库估计的先验模型来实现。该计数网格模型为每则视频生成中间张量表示,自动识别并去除不同帧间的特征冗余。随后通过计数网格上的平均将张量表示缩减为固定尺寸的向量表示。在事件检索与事件分类基准上与现有方法相比,我们以更紧凑的表示实现了显著更高的准确率。
引用
@article{arxiv.1604.01109,
title = {Counting Grid Aggregation for Event Retrieval and Recognition},
author = {Zhanning Gao and Gang Hua and Dongqing Zhang and Jianru Xue and Nanning Zheng},
journal= {arXiv preprint arXiv:1604.01109},
year = {2016}
}
备注
This paper has been withdrawn by the author because this work will be part of another object which will be released soon