中文

用于人脸识别的深度学习多视图表示

计算机视觉与模式识别 2014-06-27 v1

摘要

人脸图像中耦合了身份、视图(姿态)和光照等多种因素。解耦身份与视图表示是人脸识别面临的主要挑战。现有的人脸识别系统要么使用手工设计特征,要么判别性地学习特征以提高识别准确率,这与人类大脑的行为不同。有趣的是,即使不访问 3D 数据,人类不仅能识别人脸身份,还能根据单张 2D 图像想象一个人在不同视角下的人脸图像,使得大脑中的人脸感知对视图变化具有鲁棒性。从这个意义上说,人类大脑已经从 2D 图像中学习并编码了 3D 人脸模型。考虑到这种本能,本文提出了一种名为多视图感知机(multi-view perceptron, MVP)的新型深度神经网络,它能够在给定单张 2D 人脸图像的情况下,解耦身份和视图特征,同时推断出全谱的多视图图像。MVP 的身份特征在 MultiPIE 数据集上取得了卓越的性能。MVP 还能够对训练数据中未观察到的视角进行插值和图像预测。

关键词

引用

@article{arxiv.1406.6947,
  title  = {Deep Learning Multi-View Representation for Face Recognition},
  author = {Zhenyao Zhu and Ping Luo and Xiaogang Wang and Xiaoou Tang},
  journal= {arXiv preprint arXiv:1406.6947},
  year   = {2014}
}