中文

DigiFace-1M:用于人脸识别的百万级数字人脸图像数据集

计算机视觉与模式识别 2022-10-07 v1

摘要

最先进的人脸识别模型展现出令人印象深刻的准确率,在 Labeled Faces in the Wild (LFW) 数据集上达到了超过 99.8% 的精度。此类模型是在包含从互联网收集的数百万张真实人脸图像的大规模数据集上训练的。网络爬取的人脸图像存在严重偏差(在种族、光照、妆容等方面)且常含有标签噪声。更重要的是,这些人脸图像是在未获明确同意的情况下收集的,引发了伦理担忧。为避免此类问题,我们引入了一个用于人脸识别的大规模合成数据集,该数据集通过使用计算机图形学流水线渲染数字人脸获得。我们首先证明,激进的数据增强可以显著缩小合成到真实的域间隙。由于对渲染流水线具有完全控制,我们还研究了每个属性(例如,面部姿态、配饰和纹理的变化)如何影响准确率。与近期在 GAN 生成的合成人脸上训练的 SynFace 方法相比,我们将 LFW 上的错误率降低了 52.5%(准确率从 91.93% 提升至 96.17%)。通过在合理可经同意获取的较少真实人脸图像上微调网络,我们取得了与在数百万张真实人脸图像上训练的方法相当的准确率。

关键词

引用

@article{arxiv.2210.02579,
  title  = {DigiFace-1M: 1 Million Digital Face Images for Face Recognition},
  author = {Gwangbin Bae and Martin de La Gorce and Tadas Baltrusaitis and Charlie Hewitt and Dong Chen and Julien Valentin and Roberto Cipolla and Jingjing Shen},
  journal= {arXiv preprint arXiv:2210.02579},
  year   = {2022}
}

备注

WACV 2023