基于膨胀卷积的表观视线估计
计算机视觉与模式识别
2019-03-19 v1
摘要
基于表观的视线估计因其广泛应用而受到越来越多的关注。深度卷积神经网络的使用显著提高了精度。为了进一步提高估计精度,我们专注于从眼睛图像中提取更好的特征。视线角度的相对较大变化可能导致眼睛表观的相对较小变化。我们认为,当前用于视线估计的架构可能无法捕捉此类微小变化,因为它们应用了多个池化层或其他下采样层,使得高层特征的空间分辨率显著降低。为评估在高分辨率下提取的特征是否有利于视线估计,我们采用膨胀卷积来提取高层特征而不降低空间分辨率。在 Columbia Gaze 数据集(用于眼睛接触检测)和 MPIIGaze 数据集(用于 3D 视线向量回归)的跨被试实验中,所得 Dilated-Nets 相比无膨胀卷积的相似网络取得了显著(高达 20.8%)的提升。我们提出的 Dilated-Net 在 Columbia Gaze 和 MPIIGaze 两个数据集上均达到了 SOTA 结果。
引用
@article{arxiv.1903.07296,
title = {Appearance-Based Gaze Estimation Using Dilated-Convolutions},
author = {Zhaokang Chen and Bertram E. Shi},
journal= {arXiv preprint arXiv:1903.07296},
year = {2019}
}
备注
16 pages, 7 figures. To appear in ACCV2018