面向极深双流卷积网络的良好实践
计算机视觉与模式识别
2015-07-09 v1
摘要
深度卷积网络在静态图像的目标识别中取得了巨大成功。然而,对于视频中的动作识别,深度卷积网络的提升并不那么显著。我们认为可能有两个原因可以解释这一结果。首先,当前的网络架构(例如双流卷积网络)与图像领域中那些极深的模型(例如VGGNet、GoogLeNet)相比相对较浅,因此其建模能力受到深度的制约。其次,可能更重要的是,动作识别的训练数据集与ImageNet数据集相比极小,因此很容易在训练数据集上过拟合。为了解决这些问题,本报告提出了用于动作识别的极深双流卷积网络,通过将最近的极深架构适配到视频领域。然而,由于动作识别数据集的规模相当小,这种扩展并不容易。我们为极深双流卷积网络的训练设计了若干良好实践,即:(i) 对空间网络和时间网络均进行预训练,(ii) 使用更小的学习率,(iii) 采用更多的数据增强技术,(iv) 使用高dropout比率。同时,我们将Caffe工具箱扩展为具有高计算效率和低内存消耗的多GPU实现。我们在UCF101数据集上验证了极深双流卷积网络的性能,其识别准确率达到。
引用
@article{arxiv.1507.02159,
title = {Towards Good Practices for Very Deep Two-Stream ConvNets},
author = {Limin Wang and Yuanjun Xiong and Zhe Wang and Yu Qiao},
journal= {arXiv preprint arXiv:1507.02159},
year = {2015}
}