RAZE:基于区域引导的自监督视线表征学习
计算机视觉与模式识别
2022-08-08 v2
摘要
自动视线估计是基于视觉的辅助技术中的一个重要问题,在增强现实、虚拟现实以及人机交互等不同新兴主题中具有应用价值。过去几年中,由于无监督与自监督学习范式克服了对大规模标注数据的需求,相关研究兴趣日益增长。本文提出 RAZE,一种基于区域引导的自监督视线(gaze)表征学习框架,其利用未标注的人脸图像数据。RAZE 通过辅助监督(即伪视线区域分类)来学习视线表征,其目标是利用瞳孔中心的相对位置将视野分类为不同视线区域(即左、右和中心)。据此,我们自动标注了 154K 网络爬取图像的伪视线区域标签,并通过“Ize-Net”框架学习特征表征。“Ize-Net”是一种基于胶囊层的 CNN 架构,可有效捕获丰富的眼部表征。该特征表征的判别性在四个基准数据集上进行了评估:CAVE、TabletGaze、MPII 和 RT-GENE。此外,我们在另外两个下游任务(即驾驶员视线估计与视觉注意力估计)上评估了所提网络的泛化能力,证明了所学视线表征的有效性。
引用
@article{arxiv.2208.02485,
title = {RAZE: Region Guided Self-Supervised Gaze Representation Learning},
author = {Neeru Dubey and Shreya Ghosh and Abhinav Dhall},
journal= {arXiv preprint arXiv:2208.02485},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:1904.02459