从 Web 数据无监督生成多标签数据集
计算机视觉与模式识别
2020-06-11 v1
摘要
本文提出了一个以无监督方式从 Web 数据生成多标签数据集的系统。为了实现这一目标,本工作包含两个主要贡献,即:a) 从 Web 数据生成低噪声的无监督单标签数据集,以及 b) 在此类数据集中扩充标签(从单标签到多标签)。单标签数据集的生成使用无监督降噪阶段(聚类和使用锚点选择聚类),获得了 85% 的正确标注图像。随后执行无监督标签扩充过程,使用类激活图和与每个类相关的不确定性为数据集中的图像分配新标签。该过程应用于本文生成的数据集和一个公开数据集 (Places365),分别在这两个数据集中实现了 9.5% 和 27% 的额外标签,从而证明所提出的系统能够稳健地丰富初始数据集。
引用
@article{arxiv.2005.05623,
title = {Unsupervised Multi-label Dataset Generation from Web Data},
author = {Carlos Roig and David Varas and Issey Masuda and Juan Carlos Riveiro and Elisenda Bou-Balust},
journal= {arXiv preprint arXiv:2005.05623},
year = {2020}
}
备注
The 3rd Workshop on Visual Understanding by Learning from Web Data 2019