中文

用于可扩展图像识别的可迁移架构学习

计算机视觉与模式识别 2018-04-12 v4 机器学习 机器学习

摘要

开发神经网络图像分类模型通常需要进行大量的架构工程。本文研究了一种直接在目标数据集上学习模型架构的方法。由于当数据集较大时该方法成本高昂,我们提出在小数据集上搜索架构构建块,然后将该构建块迁移到更大的数据集。本工作的关键贡献是设计了一个新的搜索空间(“NASNet 搜索空间”),该空间实现了可迁移性。在我们的实验中,我们在 CIFAR-10 数据集上搜索最佳的卷积层(或“单元”),然后通过将更多该单元的副本堆叠在一起(每个副本都有自己的参数)来设计一个卷积架构,将其应用于 ImageNet 数据集,命名为“NASNet 架构”。我们还引入了一种名为 ScheduledDropPath 的新正则化技术,该技术显著提高了 NASNet 模型的泛化能力。在 CIFAR-10 上,NASNet 达到了 2.4% 的错误率,为当时的最优水平。在 ImageNet 上,NASNet 在已发表的工作中达到了最优准确率,在 ImageNet 上实现了 82.7% 的 top-1 和 96.2% 的 top-5 准确率。我们的模型在 top-1 准确率上比最好的人工设计架构高出 1.2%,同时 FLOPS 减少了 90 亿,比之前的最优模型计算需求降低了 28%。在不同计算成本水平下进行评估时,NASNet 的准确率超过了最优的人工设计模型。例如,一个小版本的 NASNet 也达到了 74% 的 top-1 准确率,比同等尺寸的移动平台最优模型高出 3.1%。最后,由 NASNet 学习到的特征与 Faster-RCNN 框架结合使用,在 COCO 数据集上达到了 43.1% 的 mAP,超越了最优水平 4.0%。

关键词

引用

@article{arxiv.1707.07012,
  title  = {Learning Transferable Architectures for Scalable Image Recognition},
  author = {Barret Zoph and Vijay Vasudevan and Jonathon Shlens and Quoc V. Le},
  journal= {arXiv preprint arXiv:1707.07012},
  year   = {2018}
}