中文

视频人脸识别:分量特征聚合网络 (C-FAN)

计算机视觉与模式识别 2019-07-04 v3

摘要

我们提出了一种视频人脸识别的新方法。我们的分量特征聚合网络 (C-FAN) 以某主体的多张人脸图像集合作为输入,输出一个单一特征向量作为该集合的人脸表示用于识别任务。整个网络分两步训练:(i) 训练一个基础 CNN 用于静态图像人脸识别;(ii) 在基础网络上添加一个聚合模块,以学习每个特征分量的质量值,从而自适应地将深度特征向量聚合为单一向量来表示视频中的人脸。C-FAN 自动学习保留具有高质分数的显著人脸特征,同时抑制具有低质分数的特征。在三个基准数据集 YouTube Faces、IJB-A 和 IJB-S 上的实验结果表明,所提出的 C-FAN 网络能够通过高效聚合所有视频帧的特征向量,生成具有 512 维的紧凑特征向量,从而达到最先进的性能。

关键词

引用

@article{arxiv.1902.07327,
  title  = {Video Face Recognition: Component-wise Feature Aggregation Network (C-FAN)},
  author = {Sixue Gong and Yichun Shi and Anil K. Jain},
  journal= {arXiv preprint arXiv:1902.07327},
  year   = {2019}
}