用于视觉识别的深度卷积网络中的空间金字塔池化
计算机视觉与模式识别
2016-11-18 v4
摘要
现有的深度卷积神经网络 (CNNs) 需要固定尺寸(例如 224x224)的输入图像。这一要求是“人为的”,可能会降低任意尺寸/比例的图像或子图像的识别准确率。在本工作中,我们为网络配备了另一种池化策略——“空间金字塔池化”,以消除上述要求。这种称为 SPP-net 的新网络结构可以生成与图像尺寸/比例无关的固定长度表示。金字塔池化对物体形变也具有鲁棒性。凭借这些优势,SPP-net 总体上应能改进所有基于 CNN 的图像分类方法。在 ImageNet 2012 数据集上,我们证明 SPP-net 提高了各种不同设计的 CNN 架构的准确率。在 Pascal VOC 2007 和 Caltech101 数据集上,SPP-net 使用单一全图表示且无需微调即达到了最先进的分类结果。SPP-net 在物体检测中也显示出显著威力。使用 SPP-net,我们仅从整张图像计算一次特征图,然后在任意区域(子图像)中池化特征,以生成用于训练检测器的固定长度表示。该方法避免了重复计算卷积特征。在处理测试图像时,我们的方法比 R-CNN 方法快 24-102 倍,同时在 Pascal VOC 2007 上实现了更好或相当的准确率。在 ImageNet 大规模视觉识别挑战赛 (ILSVRC) 2014 中,我们的方法在 38 支队伍中物体检测排名第 2,图像分类排名第 3。本文还介绍了针对该比赛所做的改进。
引用
@article{arxiv.1406.4729,
title = {Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition},
author = {Kaiming He and Xiangyu Zhang and Shaoqing Ren and Jian Sun},
journal= {arXiv preprint arXiv:1406.4729},
year = {2016}
}
备注
This manuscript is the accepted version for IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2015. See Changelog