在YFCC100M数据集上的大规模深度学习
机器学习
2015-02-12 v1 计算机视觉与模式识别
摘要
我们展示了一个在 HPC 架构上应用于迄今为止发布的最大公开可用自然图像和视频数据集的 150 亿参数深度学习网络的学习进行中快照。无监督深度神经网络的最新进展表明,在模型和训练数据集规模上扩大此类网络可使其在最高层概念的学习上获得显著改进。我们在 Yahoo! Flickr Creative Commons 100M dataset 上训练我们的三层深度神经网络。该数据集包含来自雅虎 Flickr 图像和视频共享平台的约 9920 万张图像和 80 万个用户创建的视频。我们的网络训练在 Lawrence Livermore National Laboratory 的 High Performance Computing Center 的 98 个 GPU 节点上耗时八天。我们提出并讨论了令人鼓舞的初步结果和未来的研究方向。
引用
@article{arxiv.1502.03409,
title = {Large-Scale Deep Learning on the YFCC100M Dataset},
author = {Karl Ni and Roger Pearce and Kofi Boakye and Brian Van Essen and Damian Borth and Barry Chen and Eric Wang},
journal= {arXiv preprint arXiv:1502.03409},
year = {2015}
}