中文

OmniGaze:基于奖励机制的野外通用三维视线估计框架

计算机视觉与模式识别 2025-10-17 v2

摘要

当前的三维视线估计方法在跨域泛化方面存在挑战,主要由于 (1) 标注数据集的稀缺 (2) 标记数据的分布不足。为此,我们提出 OmniGaze,一个基于半监督学习的三维视线估计框架,通过利用来自多样化且无约束真实环境的大规模无标签数据,以缓解领域偏差并实现野外视线估计的泛化。首先,我们构建了一个多样化的无标签人脸图像集合,涵盖不同面部外观、背景环境、光照条件、头部姿态以及眼部遮挡。为充分利用跨更广分布的无标签数据,OmniGaze 采用标准的伪标签策略,并设计一种奖励模型用于评估伪标签的可靠性。除将伪标签表示为三维方向向量外,奖励模型还融合了来自即插即用视觉编码器提取的视觉嵌入,以及由调用多模态大语言模型生成的视线视角语义线索,用于计算置信度得分。随后,这些得分被用于筛选高质量伪标签并对损失计算进行加权。大量实验表明,OmniGaze 在五个数据集上的内域和跨域设置下均实现了状态-of-the-art 性能。此外,我们还评估了 OmniGaze 作为可扩展视线估计数据引擎的有效性,该引擎在四个未见数据集上展现出鲁健的零样本泛化能力。

关键词

引用

@article{arxiv.2510.13660,
  title  = {OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild},
  author = {Hongyu Qu and Jianan Wei and Xiangbo Shu and Yazhou Yao and Wenguan Wang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2510.13660},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025; Project page: https://github.com/quhongyu/OmniGaze