中文

通用 ConvNet 表示的可迁移性因素

计算机视觉与模式识别 2015-07-16 v3

摘要

越来越多的证据表明,卷积网络 (ConvNets) 是视觉识别任务中最有效的表示学习方法。在常见场景中,ConvNet 在大型标记数据集(源)上进行训练,训练网络在某一层的馈送前单元激活被用作输入图像的通用表示,以应用于具有相对较小训练集的任务(目标)。最近的研究表明,这种形式的表示迁移适用于广泛的视觉识别目标任务。本文引入并调查了影响此类表示可迁移性的几个因素。其中包括源 ConvNet 的训练参数,如其架构、训练数据的分布等,以及特征提取的参数,如训练 ConvNet 的层、降维等。随后,通过优化这些因素,我们表明可以在各种 (17) 视觉识别任务上实现显著改进。我们进一步表明,这些视觉识别任务可以根据其与源任务的距离进行分类排序,从而观察到任务性能与其相对于所提因素与源任务的距离之间存在相关性。

关键词

引用

@article{arxiv.1406.5774,
  title  = {Factors of Transferability for a Generic ConvNet Representation},
  author = {Hossein Azizpour and Ali Sharif Razavian and Josephine Sullivan and Atsuto Maki and Stefan Carlsson},
  journal= {arXiv preprint arXiv:1406.5774},
  year   = {2015}
}

备注

Extended version of the workshop paper with more experiments and updated text and title. Original CVPR15 DeepVision workshop paper title: "From Generic to Specific Deep Representations for Visual Recognition"