开放域实时基于外观的注视估计
计算机视觉与模式识别
2026-03-31 v1
摘要
基于外观的注视估计(AGE)在受限设置中已取得显著性能,但我们揭示了一个显著的泛化差距,现有 AGE 模型在实用、无约束场景中经常失效,特别是在涉及面部可穿戴设备和光照条件不佳的情况下。我们将此归因于两个核心因素:图像多样性有限以及不同数据集间标签保真度不一致,尤其是在俯仰轴方向。为解决这些问题,我们提出了一种鲁棒的 AGE 框架,在无需额外人工标注数据的情况下增强泛化能力。首先,我们通过增强技术组合扩展图像流形,包括合成眼镜、口罩和多样化光照。其次,为缓解各数据集间各向异性标签偏差的影响,我们将注视回归重新表述为多任务学习问题,纳入多视角监督对比(SupCon)学习、离散化标签分类和眼区分割作为辅助目标。为严格验证我们的方法,我们策划了新的基准数据集,旨在评估在挑战性条件下的注视鲁棒性,这是现有评估协议 largely 忽视的维度。我们的基于 MobileNet 的轻量级模型实现了与最先进(SOTA)UniGaze-H 竞争的泛化性能,同时仅使用其不到 1% 的参数,使移动设备上的高保真实时注视追踪成为可能。
引用
@article{arxiv.2603.26945,
title = {Real-time Appearance-based Gaze Estimation for Open Domains},
author = {Zhenhao Li and Zheng Liu and Seunghyun Lee and Amin Fadaeinejad and Yuanhao Yu},
journal= {arXiv preprint arXiv:2603.26945},
year = {2026}
}