利用眼神跟随标签弱监督提升野外3D凝视估计
计算机视觉与模式识别
2025-02-28 v1
摘要
在无约束的真实世界环境中准确进行3D凝视估计仍然是一个重要挑战,主要由于外观变化、头部姿态、遮挡以及野外3D凝视数据集的稀缺。为此,我们提出一种新型的自训练弱监督凝视估计框架(ST-WSGE)。该框架包含两个阶段,利用诸如眼神跟随数据等多样化的2D凝视数据集,这些数据集在外观、自然场景和凝视分布方面具有丰富的变异性,并提出生成3D伪标签以增强模型泛化能力的方案。此外,传统的模态特定模型是为图像或视频单独设计的,限制了有效利用现有训练数据的潜力。为此,我们提出凝视变换器(Gaze Transformer, GaT),一种能够同时从图像和视频数据集中学习静态和动态凝视信息的模态无关架构。通过将3D视频数据集与眼神跟随任务中的2D凝视目标标签相结合,我们的做法实现了以下关键贡献:(i)在Gaze360和GFIE等无约束基准数据集上实现了显著的领域内和跨域泛化提升,尽管视频凝视估计中存在显著的跨模态增益;(ii) 在MPIIFaceGaze和Gaze360等数据集上实现优越的跨域性能,优于面部正视姿态方法。我们将发布代码和预训练模型供社区使用。
引用
@article{arxiv.2502.20249,
title = {Enhancing 3D Gaze Estimation in the Wild using Weak Supervision with Gaze Following Labels},
author = {Pierre Vuillecard and Jean-Marc Odobez},
journal= {arXiv preprint arXiv:2502.20249},
year = {2025}
}