基于混合生成融合的高效隐私保护人脸识别数据集生成
计算机视觉与模式识别
2025-08-19 v2 人工智能
摘要
本文提出了我们的方法,以应对 DataCV ICCV 挑战的需求,即构建高质量的人脸数据集以训练人脸识别模型。所构建的数据集必须不包含与任何现有公开人脸数据集重叠的身份信息。为处理此挑战,我们对基线 HSFace 数据集进行彻底清洁,通过结合人脸嵌入聚类和 GPT-4o 辅助验证的 Mixture-of-Experts(MoE)策略识别并删除标记不正确或不一致的身份信息。我们保留最大的一致身份簇,并对其进行数据增强,最多生成每个身份信息的固定数量图像。为进一步多样化数据集,我们使用带提示工程的 Stable Diffusion 生成合成身份信息。由于扩散模型计算密集,我们仅生成每个身份信息一个参考图像,并使用 Vec2Face 快速生成 49 个身份一致的变体。这种混合方法融合了 GAN 基于和扩散模型的样本,高效构建了多样且高质量的数据集。为解决合成身份信息之间的高视觉相似性问题,我们采用课程学习策略将其置于训练计划的早期,允许模型从容易到困难的样本逐步学习。我们的最终数据集包含每个身份信息的 50 张图像,所有新生成的身份信息均与主流人脸数据集进行检查,以确保不泄露身份信息。我们的方法在比赛中获得了 \textbf{第一名},实验结果表明,我们的数据集在 10K、20K 和 100K 身份规模上均提升了模型性能。代码可在 https://github.com/Ferry-Li/datacv_fr 获取。
关键词
引用
@article{arxiv.2508.10672,
title = {Hybrid Generative Fusion for Efficient and Privacy-Preserving Face Recognition Dataset Generation},
author = {Feiran Li and Qianqian Xu and Shilong Bao and Boyu Han and Zhiyong Yang and Qingming Huang},
journal= {arXiv preprint arXiv:2508.10672},
year = {2025}
}
备注
This paper has been accpeted to ICCV 2025 DataCV Workshop