主干-分支集成卷积神经网络用于基于视频的人脸识别
计算机视觉与模式识别
2017-05-18 v2
摘要
监控视频中的人脸常遭受严重的图像模糊、显著的姿态变化以及遮挡。本文提出一种基于卷积神经网络(CNN)的综合框架,以克服基于视频的人脸识别(VFR)中的挑战。首先,为学习模糊鲁棒的人脸表示,我们人工模糊由清晰静态图像组成的训练数据,以弥补真实世界视频训练数据的不足。利用由静态图像和人工模糊数据组成的训练数据,CNN被促使自动学习模糊不敏感特征。其次,为增强CNN特征对姿态变化和遮挡的鲁棒性,我们提出一种主干-分支集成CNN模型(TBE-CNN),其从整体人脸图像和围绕面部组件裁剪的图像块中提取互补信息。TBE-CNN是一种端到端模型,通过主干与分支网络间共享低层和中层卷积层来高效提取特征。第三,为进一步提升了TBE-CNN所学表示的判别力,我们提出一种改进的三元组损失函数。系统性实验证明了所提技术的有效性。最令人印象深刻的是,TBE-CNN在三个流行视频人脸数据库PaSC、COX Face和YouTube Faces上取得了最先进的性能。借助所提技术,我们还在BTAS 2016视频人物识别评测中获得第一名。
引用
@article{arxiv.1607.05427,
title = {Trunk-Branch Ensemble Convolutional Neural Networks for Video-based Face Recognition},
author = {Changxing Ding and Dacheng Tao},
journal= {arXiv preprint arXiv:1607.05427},
year = {2017}
}
备注
Accepted Version to IEEE T-PAMI