中文

用于视频人脸聚类的自监督人脸表示学习

计算机视觉与模式识别 2019-03-05 v1 机器学习

摘要

分析电视剧和电影背后的故事通常需要了解角色是谁以及他们在做什么。随着深度人脸模型的改进,这似乎是一个已解决的问题。然而,随着人脸检测器的改进,需要重新审视聚类/识别问题,以应对面部外观日益增加的多样性。在本文中,我们使用无监督方法解决视频人脸聚类问题。我们的重点是从使用深度预训练人脸网络获得的表示中提取基本信息,即身份。我们提出了一种自监督 Siamese 网络,该网络无需基于视频/轨迹的监督即可训练,因此也可应用于图像集合。我们在三个视频人脸聚类数据集上评估了所提出的方法。实验表明,我们的方法在所有数据集上均优于当前 SOTA 方法。视频人脸聚类缺乏一个通用基准,因为当前的工作通常使用不同的指标和/或不同的人脸轨迹集合进行评估。

关键词

引用

@article{arxiv.1903.01000,
  title  = {Self-Supervised Learning of Face Representations for Video Face Clustering},
  author = {Vivek Sharma and Makarand Tapaswi and M. Saquib Sarfraz and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:1903.01000},
  year   = {2019}
}

备注

To appear at International Conference on Automatic Face and Gesture Recognition (2019) as an Oral. The datasets and code are available at https://github.com/vivoutlaw/SSIAM