中文

无标签视频中人脸识别的无监督域自适应

计算机视觉与模式识别 2017-08-15 v1 人工智能

摘要

尽管人脸识别取得了快速进展,但基于静态图像的人脸识别与基于视频的人脸识别在性能上仍存在明显差距,这归因于两个域之间视觉质量的巨大差异,以及构建多样化的大规模视频数据集的困难。本文通过一种图像到视频的特征级域自适应方法来解决这两个挑战,以学习具有判别性的视频帧表示。该框架利用大规模无标签视频数据来缩小不同域之间的差距,同时从大规模有标签静态图像中迁移判别性知识。给定一个在图像域中预训练的人脸识别网络,该自适应通过以下方式实现: 知识蒸馏,通过特征匹配将知识从该网络蒸馏到视频自适应网络; 通过合成数据增强进行特征恢复; 通过域对抗判别器学习域不变特征。我们进一步通过判别器引导的特征融合来提升性能,该融合增强了高质量帧,同时消除了那些被视频域特定因素降级的帧。在 YouTube Faces 和 IJB-A 数据集上的实验表明,每个模块都对我们的特征级域自适应框架有所贡献,并显著提升了视频人脸识别性能,达到了 SOTA 精度。我们定性证明,该网络学会了抑制视频中的多种伪影,如姿态、光照或遮挡,而无需对其进行显式训练。

关键词

引用

@article{arxiv.1708.02191,
  title  = {Unsupervised Domain Adaptation for Face Recognition in Unlabeled Videos},
  author = {Kihyuk Sohn and Sifei Liu and Guangyu Zhong and Xiang Yu and Ming-Hsuan Yang and Manmohan Chandraker},
  journal= {arXiv preprint arXiv:1708.02191},
  year   = {2017}
}

备注

accepted for publication at International Conference on Computer Vision (ICCV) 2017