中文

DiffProb: 人脸识别的数据剪枝

计算机视觉与模式识别 2025-05-22 v1

摘要

人脸识别模型得益于深度学习技术的进步和大规模数据集的可用性而取得了显著进展。然而,依赖大规模标注数据集带来了训练计算成本和数据存储挑战,以及就大型人脸数据集的管理引发的潜在隐私问题。本文提出 DiffProb,这是人脸识别领域首个数据剪枝方法。DiffProb 评估每个身份在训练样本中的预测概率,并剪枝预测概率值相同或接近的样本,因为它们可能在强化相同的决策边界,因此贡献最小且不提供新信息。我们进一步通过辅助清理机制消除误标记和标签翻转的样本,以最小损失提升数据质量。在 CASIA-WebFace 上进行不同剪枝比例和多个基准测试(包括 LFW、CFP-FP 和 IJB-C)的大量实验表明,DiffProb 可在保持或在某些情况下甚至提升验证准确率的同时剪枝最高达 50%。此外,我们展示了 DiffProb 在不同架构和损失函数下的鲁棒性。该方法显著降低了训练成本和数据规模,使人脸识别训练更加高效,减少对大规模数据集及其严苛管理的依赖。

关键词

引用

@article{arxiv.2505.15272,
  title  = {DiffProb: Data Pruning for Face Recognition},
  author = {Eduarda Caldeira and Jan Niklas Kolf and Naser Damer and Fadi Boutros},
  journal= {arXiv preprint arXiv:2505.15272},
  year   = {2025}
}

备注

Accepted at IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2025