中文

利用预训练模型从弱标注数据自动构建新领域人脸数据集

计算机视觉与模式识别 2016-11-28 v1

摘要

训练数据在人脸识别系统中至关重要。然而,为特定领域标注大规模人脸数据非常繁琐。本文提出一种方法,借助预训练人脸模型,从互联网上容易获取的目标领域海量弱标注数据中自动且增量式地构建数据集。具体而言,给定一个大规模弱标注数据集,其中每张人脸图像关联一个标签(即某个身份的名字),我们为每个身份创建一个图,其边连接由现有模型在严格阈值下验证为匹配的人脸。然后,我们使用最大子图作为该身份的清洗后数据。利用清洗后的数据集,我们更新现有人脸模型,并使用新模型过滤原始数据集以获得更大的清洗后数据集。我们从互联网收集了一个包含7,962个身份、530,560张亚洲人脸图像的大规模弱标注数据集,该数据集将公开发布以供人脸识别研究之用。通过运行过滤过程,我们获得了一个大小为223,767(纯度99.7%以上,召回率70.9%)的清洗后数据集。在我们的亚洲人脸测试数据集上,由清洗后数据集训练的模型达到了93.1%的识别率,明显优于由公开数据集CASIA训练的模型(识别率为85.9%)。

关键词

引用

@article{arxiv.1611.08107,
  title  = {Automatically Building Face Datasets of New Domains from Weakly Labeled Data with Pretrained Models},
  author = {Shengyong Ding and Junyu Wu and Wei Xu and Hongyang Chao},
  journal= {arXiv preprint arXiv:1611.08107},
  year   = {2016}
}