用于数据标注与质量评估的自监督半监督学习
计算机视觉与模式识别
2021-11-23 v1 机器学习
摘要
随着深度学习技术在工业应用中的采用以越来越快的速度和规模增长,深度学习模型的成功部署往往取决于标注数据的可用性、数量和质量。在本文中,我们解决了人在回路设定下高效数据标注与标注验证的问题。我们展示了自监督视觉表示学习领域的最新进展可以带来有益于自然图像数据集整理与工程化的工具和方法,从而降低标注成本并提高标注质量。我们提出了一种利用自监督半监督学习的统一框架,并用它来构建数据标注和标注验证任务的工作流。我们证明了我们的工作流相对于现有方法的有效性。在主动学习任务上,我们的方法在CIFAR10上以0.1%标注数据达到97.0%的Top-1准确率,在CIFAR100上以10%标注数据达到83.9%的Top-1准确率。当使用50%错误标签学习时,我们的方法在CIFAR10上达到97.4%的Top-1准确率,在CIFAR100上达到85.5%的Top-1准确率。
引用
@article{arxiv.2111.10932,
title = {Self-supervised Semi-supervised Learning for Data Labeling and Quality Evaluation},
author = {Haoping Bai and Meng Cao and Ping Huang and Jiulong Shan},
journal= {arXiv preprint arXiv:2111.10932},
year = {2021}
}
备注
Accepted to NeurIPS 2021 DCAI Workshop