中文

一种网络爬取人脸图像数据集的整理方法

计算机视觉与模式识别 2020-04-08 v1 机器学习

摘要

网络爬取的野外数据集已成为人脸识别研究中的常态。此类数据集所获取的主体和图像数量通常非常庞大,图像数量达百万量级。在野外收集数据集时会出现多种问题,包括身份标签错误的图像、重复图像、重复主体以及质量差异。由于图像数量达百万级,人工清洗不可行。但迄今所用的全自动化方法导致数据集的洁净度不尽理想。我们提出一种半自动化方法,目标是获得用于测试人脸识别方法的洁净数据集,且在男女间质量相近,以支持跨性别的准确性比较。我们的方法去除近似重复图像、合并重复主体、纠正错标图像,并移除超出规定姿态与质量范围的图像。我们在亚洲人脸数据集(AFD)和 VGGFace2 测试数据集上进行了整理。实验表明,最先进的方法在整理后的数据集上取得了高得多的准确率。最后,我们向研究界发布了两个数据集的清洗版本。

关键词

引用

@article{arxiv.2004.03074,
  title  = {A Method for Curation of Web-Scraped Face Image Datasets},
  author = {Kai Zhang and Vítor Albiero and Kevin W. Bowyer},
  journal= {arXiv preprint arXiv:2004.03074},
  year   = {2020}
}

备注

This paper will appear at IWBF 2020