中文

面向人脸视频表示的输入聚合网络

计算机视觉与模式识别 2016-03-23 v1

摘要

近年来,深度神经网络在人脸图像识别中展现出令人鼓舞的性能。大多数网络的输入是人脸图像,而文献中鲜有以人脸视频作为输入的网络研究。为了充分挖掘人脸视频中包含的有用信息,我们提出了一种新颖的网络架构,称为输入聚合网络,它能够为可变长度的人脸视频学习固定长度的表示。为实现这一目标,我们设计了一个聚合单元,将包含不同帧数的人脸视频建模为黎曼流形上的一个点;映射单元则旨在将该点映射到高维空间,在该空间中,属于同一主体的人脸视频彼此靠近,而不同主体的视频则相距较远。这两个单元与帧表示单元共同构建了一个端到端的学习系统,能够为特定任务学习人脸视频的表示。在两个公开人脸视频数据集上的实验证明了所提网络的有效性。

关键词

引用

@article{arxiv.1603.06655,
  title  = {Input Aggregated Network for Face Video Representation},
  author = {Zhen Dong and Su Jia and Chi Zhang and Mingtao Pei},
  journal= {arXiv preprint arXiv:1603.06655},
  year   = {2016}
}