用于视频事件检索的属性包模型
信息检索
2020-12-29 v2 计算机视觉与模式识别
摘要
本文提出用于视频事件检索的Bag-of-Attributes (BoA)视频表示模型。BoA模型基于表示视频的语义特征空间,产生高层视频特征向量。为创建语义空间即属性空间,我们可以使用标记图像数据集训练分类器,获得可理解为高层码本的分类模型。该模型用于将低层帧向量映射为高层向量(如分类器概率分数)。然后,我们对帧向量应用池化操作以创建视频的最终属性包。在BoA表示中,每一维对应语义空间的一个类别(或属性)。其他有趣特性包括:紧凑性、关于分类器的灵活性、以及在单一视频表示中编码多个语义概念的能力。我们的实验考虑了由最先进的卷积神经网络在ImageNet的1000个对象类别上预训练创建的语义空间。此类深度神经网络用于分类每个视频帧,然后使用不同的编码策略将softmax层的概率分布编码为帧向量。接下来,使用不同的池化策略将帧向量组合为视频的BoA表示。在EVVE数据集的视频事件检索任务中,BoA的结果与基线相当或优于基线,且优势在于提供更紧凑的表示。
引用
@article{arxiv.1607.05208,
title = {Bag of Attributes for Video Event Retrieval},
author = {Leonardo A. Duarte and Otávio A. B. Penatti and Jurandy Almeida},
journal= {arXiv preprint arXiv:1607.05208},
year = {2020}
}