基于视觉卷积网络与时间模型的文化事件识别
计算机视觉与模式识别
2015-04-27 v1 计算机与社会
摘要
本文介绍了我们参与 ChaLearn 2015 文化事件分类挑战赛的工作。该任务的挑战在于对来自 50 个不同文化事件的图像进行自动分类。我们的解决方案基于使用分层分类器方案,将从卷积神经网络提取的视觉特征与时间信息相结合。我们从 CaffeNet(使用 ImageNet 预训练)以及我们为 ChaLearn 挑战赛微调的版本的最后三个全连接层提取视觉特征。我们提出一种晚期融合策略,对提取的每种神经编码训练一个独立的低级 SVM。低级 SVM 的类别预测构成高级 SVM 的输入,后者给出最终事件得分。我们通过向分类方案中添加时间细化步骤取得了最佳结果,该步骤直接应用于每个低级 SVM 的输出。当基于视觉特征的高分类得分的时间戳与从训练和验证数据学到的事件特定时间分布不匹配时,我们的方法对其施加惩罚。我们的系统在 ChaLearn 2015 文化事件分类挑战赛中以测试集上 0.767 的平均精度均值取得第二佳结果。
引用
@article{arxiv.1504.06567,
title = {Cultural Event Recognition with Visual ConvNets and Temporal Models},
author = {Amaia Salvador and Matthias Zeppelzauer and Daniel Manchon-Vizuete and Andrea Calafell and Xavier Giro-i-Nieto},
journal= {arXiv preprint arXiv:1504.06567},
year = {2015}
}
备注
Initial version of the paper accepted at the CVPR Workshop ChaLearn Looking at People 2015