中文

利用表观与形状线索的循环 CNN 用于三维视线估计

计算机视觉与模式识别 2018-09-18 v3

摘要

注视行为是社会信号处理和人机交互中的重要非语言线索。本文利用多模态循环卷积神经网络(CNN)解决远程摄像头下独立于人与头部姿态的三维视线估计问题。我们提出将人脸、眼部区域和人脸关键点作为 CNN 中的独立流以估计静态图像中的视线。随后,通过将所有帧的学习特征输入到多对一循环模块以预测最后一帧的三维视线向量,利用注视的动态特性。我们的多模态静态方案在广泛的头部姿态和视线方向上进行了评估,在 EYEDIAP 数据集上比现有最优方法显著提升了 14.6%,在加入时间模态后进一步提升了 4%。

关键词

引用

@article{arxiv.1805.03064,
  title  = {Recurrent CNN for 3D Gaze Estimation using Appearance and Shape Cues},
  author = {Cristina Palmero and Javier Selva and Mohammad Ali Bagheri and Sergio Escalera},
  journal= {arXiv preprint arXiv:1805.03064},
  year   = {2018}
}

备注

Proc. of British Machine Vision Conference (BMVC), BMVC 2018. Errata: in pg.5 the camera matrices of the transformation matrix W should be interchanged (correct version: W=C_n*M*(C_o)^-1)