LSUN: 利用深度学习与人在回路构建大规模图像数据集
计算机视觉与模式识别
2016-06-07 v3
摘要
尽管视觉识别算法的性能取得了显著进展,但最先进的模型往往极度依赖数据。优化深度网络模型中的数百万参数需要大型标注训练数据集,而这类数据集的制作成本高且繁琐。可用数据集在规模和密度上已落后于模型容量的增长,正迅速变得过时。为规避这一瓶颈,我们提出通过部分自动化的标注方案来放大人的努力,利用深度学习与人在回路。从每个类别的大量候选图像出发,我们迭代地采样一个子集,请人工标注,用训练好的模型对其余图像分类,基于分类置信度将集合划分为正例、负例和未标注,然后针对未标注集合继续迭代。为评估这一级联过程的有效性并推动视觉识别研究的进一步进展,我们构建了一个新的图像数据集 LSUN。它包含 10 个场景类别和 20 个对象类别各自约一百万张标注图像。我们使用流行的卷积网络进行训练实验,发现在该数据集上训练时它们取得了显著的性能提升。
引用
@article{arxiv.1506.03365,
title = {LSUN: Construction of a Large-scale Image Dataset using Deep Learning with Humans in the Loop},
author = {Fisher Yu and Ari Seff and Yinda Zhang and Shuran Song and Thomas Funkhouser and Jianxiong Xiao},
journal= {arXiv preprint arXiv:1506.03365},
year = {2016}
}