用于基于视频的注视估计的时空特征表示学习
计算机视觉与模式识别
2025-12-22 v1 人工智能
人机交互
摘要
基于视频的注视估计方法旨在从多个图像帧中捕捉人类眼神注视的内在时序动态。然而,由于模型必须同时捕捉空间和时序关系,性能受限于帧内的特征表示以及帧间的特征表示。我们提出了时空注视网络 (Spatio-Temporal Gaze Network, ST-Gaze),该网络将 CNN 主干网络与专门的通道注意力和自注意力模块相结合,以最佳方式融合眼部和面部特征。融合后的特征被视为空间序列,以捕捉帧内的上下文,然后通过时间传递以建模帧间的动态。我们在 EVE 数据集上评估了该方法,表明 ST-Gaze 在有无个体特定适应的情况下均实现了最先进的性能。此外,我们的消融研究进一步揭示了模型性能,表明通过时空递归保留和建模帧内空间上下文,优于过早的空间池化。因此,我们的结果为使用常用摄像机实现更稳健的基于视频的注视估计铺平了道路。
引用
@article{arxiv.2512.17673,
title = {Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation},
author = {Alexandre Personnic and Mihai Bâce},
journal= {arXiv preprint arXiv:2512.17673},
year = {2025}
}
备注
12 pages, 5 figures, the code repository is available at https://gitlab.kuleuven.be/u0172623/ST-Gaze