在 Transformer 的眼中:用于第一视角凝视估计的全局-局部相关性
计算机视觉与模式识别
2024-10-17 v3
摘要
在本文中,我们提出首个基于 transformer 的模型来解决具有挑战性的第一视角凝视估计问题。我们观察到,全局场景上下文与局部视觉信息之间的联系对于从第一视角视频帧中定位凝视注视点至关重要。为此,我们设计 transformer 编码器将全局上下文嵌入为一个额外的视觉 token,并进一步提出一种新颖的全局-局部相关性(GLC)模块来显式建模全局 token 与每个局部 token 的相关性。我们在两个第一视角视频数据集——EGTEA Gaze+ 和 Ego4D 上验证了我们的模型。我们详细的消融实验证明了我们所提方法的优势。此外,我们的方法大幅超越了以往的 SOTA。我们还提供了额外的可视化结果以支持我们的观点,即全局-局部相关性是预测第一视角视频中凝视注视点的关键表征。更多细节见我们的网站(https://bolinlai.github.io/GLC-EgoGazeEst)。
引用
@article{arxiv.2208.04464,
title = {In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation},
author = {Bolin Lai and Miao Liu and Fiona Ryan and James M. Rehg},
journal= {arXiv preprint arXiv:2208.04464},
year = {2024}
}
备注
23 pages