双重麻烦?人脸图像数据集中重复项的影响与检测
计算机视觉与模式识别
2024-03-07 v1
摘要
旨在用于面部生物识别研究的各种人脸图像数据集是通过网络抓取创建的,即收集互联网上公开可用的图像。本工作提出了一种使用文件哈希和图像哈希检测完全相同和高度相似的人脸图像重复项的方法。该方法通过使用人脸图像预处理进行了扩展。基于人脸识别和人脸图像质量评估模型的额外步骤减少了误报,并促进了同一受试者内和不同受试者间重复项集的人脸图像去重。所提出的方法应用于五个数据集,即 LFW、TinyFace、Adience、CASIA-WebFace 和 C-MS-Celeb(一个清理过的 MS-Celeb-1M 变体)。在每个数据集中都检测到了重复项,除了 LFW 外,所有数据集都有数百到数十万个重复项。人脸识别和质量评估实验表明,去除重复项对结果的影响较小。最终的去重数据是公开可用的。
引用
@article{arxiv.2401.14088,
title = {Double Trouble? Impact and Detection of Duplicates in Face Image Datasets},
author = {Torsten Schlett and Christian Rathgeb and Juan Tapia and Christoph Busch},
journal= {arXiv preprint arXiv:2401.14088},
year = {2024}
}
备注
Accepted at the 13th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2024)