多视角注视目标估计
计算机视觉与模式识别
2025-08-11 v1
摘要
本文提出了一种利用多个摄像机视角进行注视目标估计 (Gaze Target Estimation, GTE) 的方法。该方法整合来自不同摄像机视角的信息,以提高精度并扩大适用性,解决了现有单视角方法面临的面部遮挡、目标模糊和超出视野目标等挑战。我们的方法将一对摄像机视角作为输入,包含一个 Head Information Aggregation (HIA) 模块,用于利用两侧视角的头部信息以获得更准确的注视估计,一个 Uncertainty-based Gaze Selection (UGS) 用于识别最可靠的注视输出,以及一个 Epipolar-based Scene Attention (ESA) 模块用于跨视角背景信息共享。该方法显著优于单视角基线,尤其是在第二个摄像机提供清晰面部视图时。此外,我们的方法可以使用第二个视角中的图像仅估计第一个视角中的注视目标,这是单视角 GTE 方法所不具备的能力。此外,本文引入了一个用于开发和评估多视角 GTE 方法的多视角数据集。数据和代码均可在 https://www3.cs.stonybrook.edu/~cvl/multiview_gte.html 获取。
引用
@article{arxiv.2508.05857,
title = {Multi-view Gaze Target Estimation},
author = {Qiaomu Miao and Vivek Raju Golani and Jingyi Xu and Progga Paromita Dutta and Minh Hoai and Dimitris Samaras},
journal= {arXiv preprint arXiv:2508.05857},
year = {2025}
}
备注
Accepted to ICCV 2025