中文

目标锁定:第一人称视频中基于注视感知的目标检测

计算机视觉与模式识别 2026-03-17 v2 人工智能

摘要

人类注视为理解复杂视觉环境中的视觉注意力提供了丰富的监督信号。在本文中,我们提出了“目标锁定”,一种新颖的深度感知和注视引导的目标检测框架,专为第一人称视频设计。我们的方法将注视衍生的特征注入到 Vision Transformer 的注意力机制中,有效地将空间特征选择偏向于人类关注的区域。与对所有区域一视同仁的传统目标检测器不同,我们的方法强调观看者优先的区域以增强目标检测。我们在一个第一人称模拟器数据集上验证了我们的方法,在该数据集中,人类视觉注意力对于任务评估至关重要,这说明了其在模拟场景中评估人类表现的潜力。我们通过广泛的实验和消融研究评估了我们的注视集成模型的有效性,证明在自定义模拟器数据集和公共基准(包括 Ego4D Ego-Motion 和 Ego-CH-Gaze 数据集)上,检测精度相较于不依赖注视的基线模型有持续提升。为了解释模型行为,我们还引入了一种注视感知的注意力头重要性度量,揭示了注视线索如何调节 Transformer 的注意力动态。

关键词

引用

@article{arxiv.2511.01237,
  title  = {Eyes on Target: Gaze-Aware Object Detection in Egocentric Video},
  author = {Vishakha Lall and Yisi Liu},
  journal= {arXiv preprint arXiv:2511.01237},
  year   = {2026}
}