Gaze4HRI:面向人机交互的视线估计神经网络零样本基准测试
计算机视觉与模式识别
2026-05-07 v1 人机交互
机器学习
机器人学
摘要
尽管基于外观的零样本 3D 视线估计通过将 RGB 图像直接映射到视线向量而提供了显著的成本效率,但其在人机交互(HRI)设置中的可靠性仍不确定。现有的基准测试经常忽视基本的 HRI 条件,例如视频中的动态相机视角和移动目标。此外,当前的跨数据集评估通常存在复杂性差距,即在多样化数据集上训练的方法在显著更小且缺乏变化的数据集上进行测试,未能评估真正的鲁棒性。为了弥补这些差距,我们引入了 Gaze4HRI,这是一个大规模数据集(50+ 名受试者,3,000+ 个视频,600,000+ 帧),旨在针对关键的 HRI 变量评估 SOTA 性能:光照、头部-视线冲突以及视频中相机和视线目标的运动。我们的基准测试表明,所有评估的方法至少在一种条件下失败,并识别出急剧向下的视线为普遍的失败点。值得注意的是,在 ETH-X-Gaze 数据集上训练的 PureGaze 在所有其他条件下独特地保持了鲁棒性。这些结果对文献中近期对复杂时空建模和基于 Transformer 架构的关注提出了挑战。相反,我们的发现表明,以 ETH-X-Gaze 数据集为代表的广泛数据多样性是无约束环境中零样本鲁棒性的主要驱动力,而增强鲁棒性的框架(例如 PureGaze 用于视线特征净化的自对抗损失)则提供了进一步的实质性提升。最终,本研究建立了一个严格的基准测试,为从业者提供了实用指南,并重塑了未来的研究。数据集和代码可在 https://gazeforhri.github.io 获取。
引用
@article{arxiv.2605.04770,
title = {Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction},
author = {Berk Sezer and Ali Görkem Küçük and Erol Şahin and Sinan Kalkan},
journal= {arXiv preprint arXiv:2605.04770},
year = {2026}
}
备注
Accepted to the 2026 IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)