中文

人类注视促进以物体为中心的表征学习

计算机视觉与模式识别 2025-01-07 v1 机器学习

摘要

最近在类似人类的自我中心视觉输入上训练的自监督学习(SSL)模型在图像识别任务上的表现远不如人类。这些模型从头戴式摄像头收集的原始、均匀的视觉输入上进行训练。这与人类不同,因为视网膜和视觉皮层的解剖结构相对放大了中央视觉信息,即人类注视位置周围的信息。这种选择性放大可能有助于形成以物体为中心的视觉表征。在这里,我们研究关注中央视觉信息是否促进自我中心视觉物体学习。我们使用大规模Ego4D数据集模拟了5个月的自我中心视觉体验,并使用人类注视预测模型生成注视位置。为了解释中央视觉在人类中的重要性,我们裁剪了注视位置周围的视觉区域。最后,我们在这些修改后的输入上训练了一个基于时间的SSL模型。我们的实验表明,关注中央视觉可以导致更好的以物体为中心的表征。我们的分析表明,SSL模型利用注视运动的时间动态来构建更强的视觉表征。总的来说,我们的工作朝着生物启发的视觉表征学习迈出了重要一步。

关键词

引用

@article{arxiv.2501.02966,
  title  = {Human Gaze Boosts Object-Centered Representation Learning},
  author = {Timothy Schaumlöffel and Arthur Aubret and Gemma Roig and Jochen Triesch},
  journal= {arXiv preprint arXiv:2501.02966},
  year   = {2025}
}

备注

13 pages