HOIGaze:在扩展现实中利用眼-手-头协调进行手部-物体交互期间的凝视估计
计算机视觉与模式识别
2025-04-29 v1
摘要
我们提出 HOIGaze - 一种新颖的基于学习的方法,用于在扩展现实 (XR) 中的手部-物体交互 (HOI) 期间进行凝视估计。HOIGaze 通过建立一个关键洞察:眼睛、手和头部运动在 HOI 期间密切协调,这种协调可以被利用来识别对凝视估计器训练最有用的样本——因此有效地对训练数据进行去噪。这种去噪方法与以往的凝视估计方法形成鲜明对比,后者将所有训练样本视为平等。具体而言,我们提出: 1) 一个新颖的层次框架,首先识别当前被视线注意的手部,然后基于该被注意的手部估计凝视方向; 2) 一个新的凝视估计器,使用基于卷积神经网络和时空图卷积网络提取的头部和手部-物体特征,通过跨模态 Transformer 进行融合; 3) 一个新的眼-头协调损失,提升属于协调式眼-头运动训练样本的质量。我们在 HOT3D 和 Aria 数字孪生 (ADT) 数据集上评估了 HOIGaze,表明其显著优于最先进的方法,在 HOT3D 上的平均角度误差提高了 15.6%,在 ADT 上的平均角度误差提高了 6.0%。为了展示该方法的潜力,我们进一步报告了在 ADT 上的基于眼睛的活动识别下游任务获得显著性能提升。综上所述,我们的结果凸显了眼-手-头协调中所包含的重要信息,并因此为基于学习的凝视估计开辟了令人振奋的新方向。
引用
@article{arxiv.2504.19828,
title = {HOIGaze: Gaze Estimation During Hand-Object Interactions in Extended Reality Exploiting Eye-Hand-Head Coordination},
author = {Zhiming Hu and Daniel Haeufle and Syn Schmitt and Andreas Bulling},
journal= {arXiv preprint arXiv:2504.19828},
year = {2025}
}
备注
Accepted at SIGGRAPH 2025, link: https://zhiminghu.net/hu25_hoigaze.html