在非精选数据上无监督预训练图像特征
计算机视觉与模式识别
2019-08-14 v3
摘要
不依赖标注、使用卷积神经网络预训练通用视觉特征是一项具有挑战性且重要的任务。近期无监督特征学习的大部分工作集中于ImageNet等小规模或高度精选的数据集,而使用未精选原始数据集在被评估迁移任务时被发现会降低特征质量。我们的目标是弥合在精选数据(获取成本高)上训练的无监督方法与易获取的大规模原始数据集之间的性能差距。为此,我们提出一种新的无监督方法,利用自监督与聚类从大规模数据中捕获互补统计信息。我们在YFCC100M的9600万张图像上验证了我们的方法,在无监督方法中于标准基准上取得了最先进的结果,证实了仅有未精选数据可用时无监督学习的潜力。我们还表明,用我们的方法预训练有监督的VGG-16在ImageNet验证集上取得了74.9%的top-1分类准确率,较从头训练的同一网络提升了+0.8%。我们的代码可在 https://github.com/facebookresearch/DeeperCluster 获取。
引用
@article{arxiv.1905.01278,
title = {Unsupervised Pre-Training of Image Features on Non-Curated Data},
author = {Mathilde Caron and Piotr Bojanowski and Julien Mairal and Armand Joulin},
journal= {arXiv preprint arXiv:1905.01278},
year = {2019}
}
备注
Accepted at ICCV 2019 (Oral)