3D先验即所需:跨任务少样本2D视线估计
计算机视觉与模式识别
2025-03-26 v3
摘要
3D和2D视线估计共享捕捉眼球运动的基本目标,但传统上被视为两个不同的研究领域。在本文中,我们引入了一种新颖的跨任务少样本2D视线估计方法,旨在仅使用少量训练图像,将预训练的3D视线估计网络适配到未见过的设备上进行2D视线预测。由于3D和2D视线之间的领域差距、未知的屏幕姿态以及有限的训练数据,这项任务极具挑战性。为了解决这些挑战,我们提出了一个新颖的框架来弥合3D和2D视线之间的差距。我们的框架包含一个基于物理的可微分投影模块,该模块具有可学习的参数,用于建模屏幕姿态并将3D视线投影为2D视线。该框架是完全可微的,并且可以集成到现有的3D视线网络中,而无需修改其原始架构。此外,我们为翻转图像引入了一种动态伪标签策略,由于未知的屏幕姿态,这对于2D标签尤其具有挑战性。为了克服这个问题,我们通过将2D标签转换到3D空间来反转投影过程,并在3D空间中进行翻转。值得注意的是,这个3D空间并不与相机坐标系对齐,因此我们学习了一个动态变换矩阵来补偿这种不对齐。我们在MPIIGaze、EVE和GazeCapture数据集上评估了我们的方法,这些数据集分别在笔记本电脑、台式电脑和移动设备上收集。优越的性能突显了我们方法的有效性,并展示了其在现实世界应用中的强大潜力。
引用
@article{arxiv.2502.04074,
title = {3D Prior is All You Need: Cross-Task Few-shot 2D Gaze Estimation},
author = {Yihua Cheng and Hengfei Wang and Zhongqun Zhang and Yang Yue and Bo Eun Kim and Feng Lu and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2502.04074},
year = {2025}
}
备注
CVPR 2025