人脸识别训练/测试数据中的身份重叠:导致准确度测量乐观偏差
计算机视觉与模式识别
2024-05-16 v1
摘要
模式识别的基本原则是,训练集和测试集之间的重叠会导致乐观的准确度估计。深度 CNN 用于人脸识别是针对训练集中身份的 N 分类训练。通常将准确度估计为对来自测试集(如 LFW、CALFW、CPLFW、CFP-FP 和 AgeDB-30)中图像对的平均 10 折分类准确度。由于训练集和测试集是独立组装的,给定测试集中的图像和身份可能也存在于给定训练集中。特别是,我们的实验揭示了 LFW 系列测试集与 MS1MV2 训练集之间存在惊人的身份和图像重叠。我们的实验也揭示了 MS1MV2 中的身份标签噪声。我们比较使用相同规模的 MS1MV2 子集(身份不重叠与 LFW)以揭示乐观偏差的大小。使用来自 LFW 系列更具挑战性的测试集,我们发现更具挑战性的测试集的乐观偏差更大。我们的结果凸显了人脸识别研究中缺乏和需要身份不重叠的训练和测试方法。
引用
@article{arxiv.2405.09403,
title = {Identity Overlap Between Face Recognition Train/Test Data: Causing Optimistic Bias in Accuracy Measurement},
author = {Haiyu Wu and Sicong Tian and Jacob Gutierrez and Aman Bhatta and Kağan Öztürk and Kevin W. Bowyer},
journal= {arXiv preprint arXiv:2405.09403},
year = {2024}
}