WebFace260M:一个百万规模深度人脸识别基准
摘要
人脸基准赋能研究界训练和评估高性能人脸识别系统。本文中,我们贡献了一个新的百万规模识别基准,包含未整理的 4M 身份/260M 人脸(WebFace260M)和清洗后的 2M 身份/42M 人脸(WebFace42M)训练数据,以及一个精心设计的限时评估协议。首先,我们收集了 4M 个姓名列表并从互联网下载了 260M 张人脸。随后,设计了一种利用自训练自动清洗(CAST)流程来净化庞大的 WebFace260M,该流程高效且可扩展。据我们所知,清洗后的 WebFace42M 是最大的公开人脸识别训练集,我们期望借此缩小学术界与工业界之间的数据鸿沟。参考实际部署,构建了推理时间受限下的人脸识别(FRUITS)协议以及一个具有丰富属性的新测试集。此外,我们收集了一个大规模戴口罩人脸子集用于 COVID-19 下的生物特征评估。为对人脸匹配器进行全面评估,分别在标准、戴口罩和无偏置设定下执行了三项识别任务。借助该基准,我们深入研究了百万规模人脸识别问题。开发了一种分布式框架,可在不影响性能的前提下高效训练人脸识别模型。在 WebFace42M 的支撑下,我们在具有挑战性的 IJB-C 集上降低了 40% 的失败率,并在 NIST-FRVT 的 430 个提交中排名第 3。即便仅用 10% 的数据(WebFace4M)也展现出优于公开训练集的性能。此外,在 FRUITS-100/500/1000 毫秒协议下建立了全面的基线。所提出的基准在标准、戴口罩和无偏置人脸识别场景中展现出巨大潜力。我们的 WebFace260M 网站为 https://www.face-benchmark.org。
引用
@article{arxiv.2204.10149,
title = {WebFace260M: A Benchmark for Million-Scale Deep Face Recognition},
author = {Zheng Zhu and Guan Huang and Jiankang Deng and Yun Ye and Junjie Huang and Xinze Chen and Jiagang Zhu and Tian Yang and Dalong Du and Jiwen Lu and Jie Zhou},
journal= {arXiv preprint arXiv:2204.10149},
year = {2022}
}
备注
Accepted by T-PAMI. Extension of our CVPR-2021 work: arXiv:2103.04098. Project website is https://www.face-benchmark.org