中文

基于自注意力增强卷积的视线估计方法

计算机视觉与模式识别 2020-11-04 v2

摘要

三维视线估计与多个领域高度相关,包括但不限于交互系统、专用人机接口以及行为研究。尽管近期深度学习方法已提升了基于表观的视线估计的精度,但针对这一特定任务的网络架构仍有改进空间。因此,我们在此提出一种基于自注意力增强卷积的新颖网络架构,以在较浅残差网络训练过程中提升所学特征的质量。其原理在于,自注意力机制可通过学习全脸图像中远距离区域间的依赖关系,超越更深架构的表现。该机制还能在视线回归之前,从人脸与眼睛图像中生成更好且更具空间感知的特征表示。我们将此框架命名为 ARes-gaze,其采用我们的注意力增强残差网络(ARes-14)作为双卷积骨干。在我们的实验中,结果表明在 MPIIFaceGaze 数据集上与 SOTA 方法相比平均角度误差降低了 2.38%,并在 EyeDiap 数据集上取得第二名的成绩。值得注意的是,我们所提框架是唯一同时在两个数据集上均达到高精度的。

关键词

引用

@article{arxiv.2008.11055,
  title  = {On estimating gaze by self-attention augmented convolutions},
  author = {Gabriel Lefundes and Luciano Oliveira},
  journal= {arXiv preprint arXiv:2008.11055},
  year   = {2020}
}