中文

用于视频人脸表征与识别的自注意力聚合网络

计算机视觉与模式识别 2020-10-13 v1

摘要

基于自注意力机制的模型在分析时序数据方面已取得成功,并广泛应用于自然语言领域。我们提出了一种基于自注意力机制的视频人脸表征与识别新模型架构。我们的方法可用于包含单身份和多身份的视频。据我们所知,尚无人探索过考虑多身份视频的聚合方法。所提方法利用现有模型(如 ArcFace 和 MobileFaceNet)获取每帧视频的人脸表征,聚合模块通过考虑帧的顺序及其质量分数,生成视频的聚合人脸表征向量。我们在名为 IJB-C 的公开视频人脸识别数据集上展示了实证结果,表明自注意力聚合网络(SAAN)优于朴素平均池化。此外,我们基于公开可用的 UMDFaces 数据集和从 Giphy 收集的 GIF 引入了一个新的多身份视频数据集。我们表明 SAAN 能够为视频中的单身份和多身份生成紧凑的人脸表征。数据集与源代码将公开可用。

关键词

引用

@article{arxiv.2010.05340,
  title  = {Self-attention aggregation network for video face representation and recognition},
  author = {Ihor Protsenko and Taras Lehinevych and Dmytro Voitekh and Ihor Kroosh and Nick Hasty and Anthony Johnson},
  journal= {arXiv preprint arXiv:2010.05340},
  year   = {2020}
}