中文

视频中的特定人脸识别

计算机视觉与模式识别 2020-06-11 v1

摘要

本文采用度量学习方法和相似性排序模型解决视频中的人脸识别问题。文章比较了采用对比损失的 Siamese 网络与采用三元组损失的三元组网络,实现了以下架构:Google/Inception 架构、3D 卷积网络(C3D)以及 2-D 长短期记忆(LSTM)循环神经网络。我们利用来自视频的静态图像和序列训练网络,并比较上述架构的性能。所用数据集为专为研究视频人脸识别问题而设计的 YouTube Face Database。本文的贡献有两方面:首先,实验确定在静态图像的前 nn 名排序人脸检索中,在图像序列上使用对比损失的 3-D 卷积网络和 2-D LSTM 并未超越使用对比损失的 Google/Inception 架构。然而,在数据集的前 nn 名排序人脸检索中,使用三元组损失的 3-D 卷积网络和 2-D LSTM 优于使用三元组损失的 Google/Inception;其次,将支持向量机(SVM)与 CNN 学习到的特征表示结合用于人脸辨识。结果表明,相较于对比损失,使用三元组损失学习的特征表示在 n-shot 人脸辨识中明显更优。最具效用的人脸辨识特征表示来自带三元组损失的 2-D LSTM。实验显示,从视频序列中学习时空特征有益于视频中的人脸识别。

关键词

引用

@article{arxiv.2006.05713,
  title  = {Unique Faces Recognition in Videos},
  author = {Jiahao Huo and Terence L van Zyl},
  journal= {arXiv preprint arXiv:2006.05713},
  year   = {2020}
}

备注

Paper was accepted into Fusion 2020 conference but will only be published after the virtual conference in July 2020. 7 pages long