中文

从噪声网络图像中学习深度表示

计算机视觉与模式识别 2016-07-19 v2 多媒体

摘要

网络图像不断增长的内容可能成为扩展深度神经网络的下一个重要数据源,这些网络最近在 ImageNet 分类挑战及相关任务中取得了巨大成功。然而,由于卷积网络(convnet)——性能最佳的深度模型之一——的监督训练机制,这一前景尚未在卷积网络上得到验证。尽管无监督替代方法在将学习到的模型泛化到新领域方面不如卷积网络,我们仍使用卷积网络来利用半监督表示学习。我们的方法是利用海量未标注和噪声网络图像来训练卷积网络作为通用特征检测器,尽管数据带来诸如高比例错误标注数据、离群值和数据偏差等挑战。我们在多种数据规模、不同网络架构和数据重排序技术上进行了大量实验。学习到的表示在九个不同主题的公共数据集上进行了评估。我们的卷积网络在 314 万张网络图像上训练得到的最佳结果,优于在 ILSVRC 2012 的 120 万张干净图像上训练的 AlexNet,并正在缩小与 VGG-16 的差距。这些显著结果提出了一种在实践中使用深度学习的经济解决方案,并激励了更多关于半监督表示学习的研究。

关键词

引用

@article{arxiv.1512.04785,
  title  = {On Deep Representation Learning from Noisy Web Images},
  author = {Phong D. Vo and Alexandru Ginsca and Hervé Le Borgne and Adrian Popescu},
  journal= {arXiv preprint arXiv:1512.04785},
  year   = {2016}
}