中文

重新审视深度学习时代数据的不合理有效性

计算机视觉与模式识别 2017-08-07 v2 人工智能

摘要

深度学习在视觉上的成功可归因于:(a) 高容量模型;(b) 增加的计算能力;(c) 大规模标注数据的可用性。自2012年以来,模型的表示能力和 GPU 的计算能力取得了显著进展。但最大数据集的规模却出奇地保持不变。如果我们把数据集规模增加10倍或100倍会怎样?本文致力于澄清围绕“海量数据”与视觉深度学习之间关系的神秘迷雾。通过利用 JFT-300M 数据集(该数据集包含3亿张图像的超过3.75亿个噪声标签),我们研究了如果使用此数据进行表示学习,当前视觉任务的性能将如何变化。我们的论文给出了一些令人惊讶(以及一些预期)的发现。首先,我们发现视觉任务的性能基于训练数据规模呈对数增长。其次,我们展示表示学习(或预训练)仍然大有可为。仅通过训练更好的基础模型,就可以改善许多视觉任务的性能。最后,正如预期,我们给出了针对不同视觉任务的新最先进结果,包括图像分类、目标检测、语义分割和人体姿态估计。我们诚挚希望这能激励视觉界不要低估数据,并发展集体努力来构建更大数据集。

关键词

引用

@article{arxiv.1707.02968,
  title  = {Revisiting Unreasonable Effectiveness of Data in Deep Learning Era},
  author = {Chen Sun and Abhinav Shrivastava and Saurabh Singh and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1707.02968},
  year   = {2017}
}

备注

ICCV 2017 camera ready