中文

基于多任务流形深度学习的多模态人脸姿态估计

计算机视觉与模式识别 2017-12-19 v1

摘要

人脸姿态估计旨在利用二维图像估计注视方向或头部姿态。它提供了一些非常重要的信息,如交流手势、显著性检测等,近年来引起了大量关注。然而,由于复杂的背景、多样的朝向以及人脸外观可见性,该任务具有挑战性。因此,对人脸图像进行描述性表示并将其映射到姿态至关重要。本文利用多模态数据,提出了一种新颖的人脸姿态估计方法,该方法使用名为多任务流形深度学习 M2DLM^2DL 的新型深度学习框架。它基于改进深度神经网络的特征提取以及基于多任务学习的多模态映射关系。在所提出的基于深度学习的框架中,流形正则化卷积层(MRCL)通过学习神经元输出之间的关系来改进传统卷积层。此外,在提出的映射关系学习方法中,人脸表示的不同模态被自然地结合以学习从人脸图像到姿态的映射函数。通过这种方式,具有多任务的映射模型得到改进。在三个具有挑战性的基准数据集 DPOSE、HPID 和 BKHPD 上的实验结果证明了 M2DLM^2DL 的优异性能。

关键词

引用

@article{arxiv.1712.06467,
  title  = {Multi-modal Face Pose Estimation with Multi-task Manifold Deep Learning},
  author = {Chaoqun Hong and Jun Yu},
  journal= {arXiv preprint arXiv:1712.06467},
  year   = {2017}
}