WebFace260M:揭示百万规模深度人脸识别能力的基准
计算机视觉与模式识别
2021-03-09 v1
摘要
本文中,我们贡献了一个包含含噪的 4M 身份/260M 人脸(WebFace260M)和清洗后的 2M 身份/42M 人脸(WebFace42M)训练数据,以及精心设计的限时评估协议的新百万规模人脸基准。首先,我们收集了 4M 姓名列表并从互联网下载了 260M 人脸。随后,设计了利用自训练自动清洗(CAST)流水线来净化庞大的 WebFace260M,该流水线高效且可扩展。据我们所知,清洗后的 WebFace42M 是最大的公开人脸识别训练集,我们期望缩小学术界与工业界之间的数据差距。参考实际场景,构建了推理时间受限下的人脸识别(FRUITS)协议和测试集以全面评估人脸匹配器。借助该基准,我们深入研究了百万规模人脸识别问题。开发了分布式框架以在不损害性能的前提下高效训练人脸识别模型。在 WebFace42M 的赋能下,我们在具挑战性的 IJB-C 集上降低了 40% 的相对失败率,并在 NIST-FRVT 的 430 个提交中排名第 3。即便 10% 的数据(WebFace4M)也展现出优于公开训练集的性能。此外,在 FRUITS-100ms/500ms/1000ms 协议下,于我们富含属性的测试集上建立了全面的基线,包括 MobileNet、EfficientNet、AttentionNet、ResNet、SENet、ResNeXt 和 RegNet 系列。基准网站为 https://www.face-benchmark.org。
引用
@article{arxiv.2103.04098,
title = {WebFace260M: A Benchmark Unveiling the Power of Million-Scale Deep Face Recognition},
author = {Zheng Zhu and Guan Huang and Jiankang Deng and Yun Ye and Junjie Huang and Xinze Chen and Jiagang Zhu and Tian Yang and Jiwen Lu and Dalong Du and Jie Zhou},
journal= {arXiv preprint arXiv:2103.04098},
year = {2021}
}
备注
Accepted by CVPR2021. Benchmark website is https://www.face-benchmark.org