中文

按身份聚类数百万张人脸

计算机视觉与模式识别 2016-04-05 v1

摘要

在这项工作中,我们试图解决以下问题:给定大量未标注的人脸图像,将其聚类为数据中存在的各个身份。我们认为这在从社交媒体到执法等不同应用场景中都是一个相关问题。在大规模场景下,集合中的人脸数量可达数亿量级,而聚类数可从几千到数百万不等——这在运行时间复杂度和评估聚类及每聚类质量方面均带来困难。我们开发了一种高效且有效的排序聚类(Rank-Order clustering)算法,以实现所需的可扩展性,并取得比k-means和谱聚类等其他知名算法更好的聚类精度。我们将多达1.23亿张人脸图像聚类为超过1000万个簇,并基于外部聚类质量度量(已知人脸标签)和内部聚类质量度量(未知人脸标签)以及运行时间对结果进行了分析。我们的算法在基准无约束人脸数据集(LFW,包含13K张人脸)上取得了0.87的F值,在考虑的最大数据集(LFW中13K图像加上123M干扰图像)上取得了0.27的F值。此外,我们展示了关于视频帧聚类的初步工作(在对基准YouTube Faces数据集中的所有帧进行聚类时取得了0.71的F值)。我们提出了一种每聚类质量度量,可用于对各个簇排序,并自动识别出高质量簇的子集以供人工探查。

关键词

引用

@article{arxiv.1604.00989,
  title  = {Clustering Millions of Faces by Identity},
  author = {Charles Otto and Dayong Wang and Anil K. Jain},
  journal= {arXiv preprint arXiv:1604.00989},
  year   = {2016}
}