Vec2Face+:面向人脸数据集生成
计算机视觉与模式识别
2025-07-29 v2
摘要
在合成用于人脸识别训练数据的身份时,普遍认为大的类间可分性和类内属性变化对于生成高质量数据集至关重要。然而,在增加类内变化时,现有方法忽略了维持类内身份一致性的必要性。为解决此问题并生成高质量的人脸训练数据,我们提出了Vec2Face+,这是一种生成模型,可直接从图像特征创建图像,并允许连续且轻松地控制人脸身份和属性。使用Vec2Face+,我们通过三种策略获得了具有适当类间可分性、类内变化和身份一致性的数据集:1) 我们采样与其他向量足够不同的向量以生成分离良好的身份;2) 我们提出了一种AttrOP算法来增加一般属性变化;3) 我们提出了基于LoRA的姿态控制,用于生成具有侧面头部姿态的图像,这比AttrOP更高效且更能保持身份。我们的系统生成了VFace10K,一个包含10K个身份的合成人脸数据集,使得人脸识别模型在七个真实世界测试集上达到了最先进的精度。将规模扩展到4M和12M图像后,相应的VFace100K和VFace300K数据集在五个真实世界测试集上取得了比真实世界训练数据集CASIA-WebFace更高的精度。这是合成数据集首次在平均精度上超越CASIA-WebFace。此外,我们发现,在11个合成数据集中,只有1个在双胞胎验证中优于随机猜测(即50%),并且使用合成身份训练的模型比使用真实身份训练的模型更具偏差。这两点都是未来研究的重要方面。代码可在 https://github.com/HaiyuWu/Vec2Face_plus 获取。
引用
@article{arxiv.2507.17192,
title = {Vec2Face+ for Face Dataset Generation},
author = {Haiyu Wu and Jaskirat Singh and Sicong Tian and Liang Zheng and Kevin W. Bowyer},
journal= {arXiv preprint arXiv:2507.17192},
year = {2025}
}