MTGLS:有限监督下的多任务视线估计
计算机视觉与模式识别
2021-12-14 v2
摘要
由于大规模标注数据的缺失,即便对于深度CNN而言,鲁棒的视线估计也是一项具有挑战性的任务。此外,视线标注是一个耗时的过程,并且需要专门的硬件设置。我们提出MTGLS:一种有限监督下的多任务视线估计框架,其利用了大量可用的无标注人脸图像数据。MTGLS从现成的面部图像分析模型中蒸馏知识,并在三种互补辅助信号的引导下学习人眼强有力的特征表示:(a) 由定位的面部关键点定义的瞳孔视线(即伪视线),(b) 由欧拉角给出的头部姿态,以及 (c) 眼块(左/右眼)的方向。为克服监督信号中固有的噪声,MTGLS进一步引入了噪声分布建模方法。我们的实验结果表明,MTGLS学习到了高度泛化的表示,并在一系列数据集上持续表现良好。我们提出的框架在CAVE数据集上优于无监督SOTA(提升6.43%),甚至在Gaze360数据集上优于有监督SOTA方法(提升6.59%)。
引用
@article{arxiv.2110.12100,
title = {MTGLS: Multi-Task Gaze Estimation with Limited Supervision},
author = {Shreya Ghosh and Munawar Hayat and Abhinav Dhall and Jarrod Knibbe},
journal= {arXiv preprint arXiv:2110.12100},
year = {2021}
}