中文

用于个性化视频视线估计的时空注意力与高斯过程

计算机视觉与模式识别 2024-04-11 v2

摘要

视线是分析人类行为和注意力的重要提示。近期,从面部视频中确定视线方向引起了越来越多的兴趣。然而,视频视线估计面临重大挑战,例如理解视频序列中视线的动态演变、处理静态背景以及适应光照变化。为了应对这些挑战,我们提出了一种简单且新颖的深度学习模型,旨在从视频中估计视线,并结合了一个专门的注意力模块。我们的方法采用空间注意力机制来跟踪视频内的空间动态。该技术通过时间序列模型实现准确的视线方向预测,熟练地将空间观测转化为时间洞察,从而显著提高视线估计精度。此外,我们的方法集成了高斯过程以包含个体特定特征,仅需少量标注样本即可实现模型的个性化。实验结果证实了所提方法的有效性,证明了其在数据集内和数据集间设置中的成功。具体而言,我们提出的方法在 Gaze360 数据集上取得了 SOTA 性能,在未个性化情况下改善了 2.52.5^\circ。进一步地,仅用三个样本对模型进行个性化,我们获得了额外的 0.80.8^\circ 改善。代码和预训练模型可在 \url{https://github.com/jswati31/stage} 获取。

关键词

引用

@article{arxiv.2404.05215,
  title  = {Spatio-Temporal Attention and Gaussian Processes for Personalized Video Gaze Estimation},
  author = {Swati Jindal and Mohit Yadav and Roberto Manduchi},
  journal= {arXiv preprint arXiv:2404.05215},
  year   = {2024}
}

备注

Accepted at CVPR 2024 Gaze workshop