中文

用于视频人脸识别的神经聚合网络

计算机视觉与模式识别 2017-08-03 v4 人工智能

摘要

本文提出一种用于视频人脸识别的神经聚合网络(NAN)。该网络以一个人的具有可变数量人脸图像的人脸视频或人脸图像集作为输入,并产生用于识别的紧凑固定维度特征表示。整个网络由两个模块组成。特征嵌入模块是深度卷积神经网络(CNN),其将每张人脸图像映射到特征向量。聚合模块由两个注意力块组成,其自适应地聚合特征向量以在它们所张成的凸包内形成单个特征。由于注意力机制,聚合对人脸图像顺序不变。我们的NAN使用标准分类或验证损失训练,无需任何额外监督信号,并且我们发现它自动学习提倡高质量人脸图像而排斥低质量图像如模糊、遮挡和曝光不当的人脸。在IJB-A、YouTube Face、Celebrity-1000视频人脸识别基准上的实验表明它持续优于朴素聚合方法并达到最先进精度。

关键词

引用

@article{arxiv.1603.05474,
  title  = {Neural Aggregation Network for Video Face Recognition},
  author = {Jiaolong Yang and Peiran Ren and Dongqing Zhang and Dong Chen and Fang Wen and Hongdong Li and Gang Hua},
  journal= {arXiv preprint arXiv:1603.05474},
  year   = {2017}
}

备注

Post CVPR2017 version with minor typo fix