现成CNN特征:令人惊叹的识别基线
计算机视觉与模式识别
2014-05-13 v3
摘要
近期结果表明,从卷积神经网络中提取的通用描述符非常强大。本文进一步提供了证明这一结论的确凿证据。我们使用公开可用的 \overfeat 网络代码和模型进行了一系列实验,该网络在 ILSVRC13 上经过训练以执行目标分类。我们将从 \overfeat 网络提取的特征作为通用图像表示,以应对应用于多种数据集的各类识别任务,包括目标图像分类、场景识别、细粒度识别、属性检测和图像检索。我们选择这些任务和数据集是因为它们逐渐远离 \overfeat 网络最初被训练去解决的任务和数据。令人惊讶的是,我们报告称,在各种数据集上的所有视觉分类任务中,与经过高度调优的 SOTA 系统相比,均取得了一致的更优结果。在实例检索中,除雕塑数据集外,它始终优于低内存占用方法。这些结果是通过将线性 SVM 分类器(或在检索情况下使用 距离)应用于从网络某一层提取的大小为 4096 的特征表示来实现的。该表示还通过简单的数据增强技术(如抖动)进行了进一步改进。这些结果有力地表明,通过卷积网络深度学习获得的特征应成为大多数视觉识别任务的首选。
引用
@article{arxiv.1403.6382,
title = {CNN Features off-the-shelf: an Astounding Baseline for Recognition},
author = {Ali Sharif Razavian and Hossein Azizpour and Josephine Sullivan and Stefan Carlsson},
journal= {arXiv preprint arXiv:1403.6382},
year = {2014}
}
备注
version 3 revisions: 1)Added results using feature processing and data augmentation 2)Referring to most recent efforts of using CNN for different visual recognition tasks 3) updated text/caption