中文

人脸识别的症结在于噪声

计算机视觉与模式识别 2018-08-01 v1

摘要

人脸识别数据集规模的不断增长使我们能够训练出用于人脸识别的强卷积网络。尽管已设计出多种架构与损失函数,我们对现有数据集中固有的标签噪声的来源与后果仍理解有限。我们的贡献如下:1)我们贡献了流行人脸数据库(即MegaFace与MS-Celeb-1M数据集)的清洗子集,并构建了一个大规模噪声可控的IMDb-Face新数据集。2)利用原始数据集与清洗子集,我们对MegaFace与MS-Celeb-1M的标签噪声特性进行了刻画与分析。我们表明,要达到与干净子集相同的准确率,需要多几个数量级的样本。3)我们研究了不同类型噪声(即标签翻转与离群点)与人脸识别模型准确率之间的关联。4)我们探究了提升数据洁净度的方法,包括一项关于数据标注策略对标注准确率影响的综合用户研究。IMDb-Face数据集已发布于https://github.com/fwang91/IMDb-Face。

关键词

引用

@article{arxiv.1807.11649,
  title  = {The Devil of Face Recognition is in the Noise},
  author = {Fei Wang and Liren Chen and Cheng Li and Shiyao Huang and Yanjie Chen and Chen Qian and Chen Change Loy},
  journal= {arXiv preprint arXiv:1807.11649},
  year   = {2018}
}

备注

accepted to ECCV'18