中文

3DGazeNet:基于合成视图弱监督的通用目光估计

计算机视觉与模式识别 2023-12-15 v3

摘要

开发能很好泛化到未知域和真实场景条件的目光估计模型仍是一项挑战,尚无已知最佳方案。这主要由于难以获取覆盖真实世界中人脸、头部姿态和环境分布的地面真值数据。多数近期方法试图通过域适应缩小特定源域与目标域间的差距。在本工作中,我们提出训练可直接用于新环境而无需适应的通用目光估计模型。为此,我们利用以下观察:头部、身体和手部姿态估计得益于将其重构为密集 3D 坐标预测,并类似地将目光估计表达为密集 3D 眼部网格的回归。为缩小图像域差距,我们创建了带有目光伪标注的多样化人脸大规模数据集,基于场景的 3D 几何提取标注,并设计多视图监督框架以平衡训练时其影响。我们在目光泛化任务中测试了我们的方法,结果表明在无地面真值数据时相较最先进方法提升达 30%,有数据时提升达 10%。项目资料用于研究目的见于 https://github.com/Vagver/3DGazeNet。

关键词

引用

@article{arxiv.2212.02997,
  title  = {3DGazeNet: Generalizing Gaze Estimation with Weak-Supervision from Synthetic Views},
  author = {Evangelos Ververas and Polydefkis Gkagkos and Jiankang Deng and Michail Christos Doukas and Jia Guo and Stefanos Zafeiriou},
  journal= {arXiv preprint arXiv:2212.02997},
  year   = {2023}
}

备注

17 pages, 13 figures