GazeShift:面向 VR 的无监督注视估计与数据集
计算机视觉与模式识别
2026-03-25 v3
摘要
注视估计是现代虚拟现实(VR)系统中的关键技术。尽管远程摄像头注视估计取得了显著进展,但 VR 注视研究仍受数据稀缺限制,尤其缺乏使用现代 headset 典型 off-axis 摄像头配置捕获的大规模、准确标注数据集。注视标注困难,因为无法保证对预期目标的固定焦点。为此,我们引入 VRGaze,首个面向 VR 的大规模 off-axis 注视估计数据集,包含来自 68 名参与者的 210 万张 near-eye 红外图像。我们进一步提出 GazeShift,一种基于注意力引导的无监督框架,用于学习注视表示。不同于依赖多视角或 3D 几何的 prior 方法,GazeShift 专为 near-eye imagery 设计,实现了紧凑实时的 gaze-appearance 解耦。GazeShift 嵌入可通过轻量级 few-shot 校准适应 individual 用户,实现 1.84° 平均误差。在远程摄像头 MPIIGaze 数据集上,模型实现 7.15° person-agnostic 误差,所需参数仅为基线方法的 1/10,计算复杂度为 1/35。在 VR headset GPU 上原生部署后,推理仅需 5 ms。结合对光照变化的鲁棒性,这些结果凸显了 GazeShift 作为 VR 注视跟踪的 label-efficient、实时解决方案。项目代码和 VRGaze 数据集已发布于 https://github.com/gazeshift3/gazeshift。
引用
@article{arxiv.2603.07832,
title = {GazeShift: Unsupervised Gaze Estimation and Dataset for VR},
author = {Gil Shapira and Ishay Goldin and Evgeny Artyomov and Donghoon Kim and Yosi Keller and Niv Zehngut},
journal= {arXiv preprint arXiv:2603.07832},
year = {2026}
}
备注
Accepted to CVPR26