中文

视频监控中人脸识别的深度学习架构

计算机视觉与模式识别 2018-06-28 v2

摘要

用于视频监控(VS)应用的人脸识别(FR)系统试图在分布式摄像机网络上准确检测目标个体的出现。在基于视频的 FR 系统中,目标个体的面部模型是在注册阶段使用有限数量的参考静态图像或视频数据先验设计的。由于光照、姿态、尺度、遮挡、模糊方面的巨大变化以及摄像机互操作性,这些面部模型通常不能代表运行期间观测到的人脸。具体而言,在静态到视频 FR 应用中,使用受控条件下静态摄像机捕获的单张高质量参考静态图像来生成面部模型,随后与不受控条件下视频摄像机捕获的较低质量人脸进行匹配。当前基于视频的 FR 系统在受控场景中表现良好,而在不受控场景中性能不尽如人意,主要因为源(注册)域与目标(运行)域之间的差异。该领域多数努力致力于在非受限监控环境中设计鲁棒的基于视频的 FR 系统。本章通过深度卷积神经网络(CNNs)概述静态到视频 FR 场景的最新进展。特别地,回顾并比较了文献中提出的基于三元组损失函数(例如,互相关匹配 CNN、主干-分支集成 CNN 和 HaarNet)和监督自编码器(例如,规范人脸表示 CNN)的深度学习架构在准确率和计算复杂度方面的表现。

关键词

引用

@article{arxiv.1802.09990,
  title  = {Deep Learning Architectures for Face Recognition in Video Surveillance},
  author = {Saman Bashbaghi and Eric Granger and Robert Sabourin and Mostafa Parchami},
  journal= {arXiv preprint arXiv:1802.09990},
  year   = {2018}
}