数据集清洗——基于人脸识别的大规模人脸数据集交叉验证方法
计算机视觉与模式识别
2020-03-25 v1 数据库
摘要
近年来,大规模“野生”人脸数据集被发布,以推动人脸检测、人脸识别及其他任务的进展。这些数据集大多通过自动程序从网页获取。因此,常出现噪声数据。此外,在这些大规模人脸数据集中,身份标注十分重要,因为它们被用于训练人脸识别算法。但由于数据集的自动收集方式及其大规模,许多身份文件夹包含误标样本,降低了数据集质量。本文提出一种利用人脸识别清洗含噪声大规模人脸数据集的半自动方法。该方法被应用于清洗 CelebA 数据集并展现其有效性。此外,文中提供了 CelebA 数据集中的误标样本列表。
引用
@article{arxiv.2003.10815,
title = {Dataset Cleaning -- A Cross Validation Methodology for Large Facial Datasets using Face Recognition},
author = {Viktor Varkarakis and Peter Corcoran},
journal= {arXiv preprint arXiv:2003.10815},
year = {2020}
}
备注
2020 Twelfth International Conference on Quality of Multimedia Experience (QoMEX)