ImageNet Shuffle:面向视频事件检测的重组织预训练
计算机视觉与模式识别
2017-12-14 v1
摘要
本文致力于使用从深度卷积神经网络学到的表示进行视频事件检测。与均从ImageNet大规模视觉识别挑战赛定义的1,000个类别学习的主流方法不同,我们研究如何利用完整的ImageNet层级结构来预训练深度网络。为处理类别过细以及少图像类别的问题,我们提出一种自底向上和自顶向下的方法来基于其全部21,814个类别和超过1400万张图像对ImageNet层级结构进行重组织。在TRECVID多媒体事件检测2013和2015数据集上的实验表明,从用我们的重组织层级预训练的深度神经网络各层导出的视频表示 i) 优于标准预训练,ii) 在不同重组织间互补,iii) 保持与其他模态融合的收益,且 iv) 取得了最先进的事件检测结果。重组织后的层级及其导出的Caffe模型公开于 http://tinyurl.com/imagenetshuffle。
引用
@article{arxiv.1602.07119,
title = {The ImageNet Shuffle: Reorganized Pre-training for Video Event Detection},
author = {Pascal Mettes and Dennis C. Koelma and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:1602.07119},
year = {2017}
}