人类注视促进以物体为中心的表征学习
计算机视觉与模式识别
2025-01-07 v1 机器学习
摘要
最近在类似人类的自我中心视觉输入上训练的自监督学习(SSL)模型在图像识别任务上的表现远不如人类。这些模型从头戴式摄像头收集的原始、均匀的视觉输入上进行训练。这与人类不同,因为视网膜和视觉皮层的解剖结构相对放大了中央视觉信息,即人类注视位置周围的信息。这种选择性放大可能有助于形成以物体为中心的视觉表征。在这里,我们研究关注中央视觉信息是否促进自我中心视觉物体学习。我们使用大规模Ego4D数据集模拟了5个月的自我中心视觉体验,并使用人类注视预测模型生成注视位置。为了解释中央视觉在人类中的重要性,我们裁剪了注视位置周围的视觉区域。最后,我们在这些修改后的输入上训练了一个基于时间的SSL模型。我们的实验表明,关注中央视觉可以导致更好的以物体为中心的表征。我们的分析表明,SSL模型利用注视运动的时间动态来构建更强的视觉表征。总的来说,我们的工作朝着生物启发的视觉表征学习迈出了重要一步。
引用
@article{arxiv.2501.02966,
title = {Human Gaze Boosts Object-Centered Representation Learning},
author = {Timothy Schaumlöffel and Arthur Aubret and Gemma Roig and Jochen Triesch},
journal= {arXiv preprint arXiv:2501.02966},
year = {2025}
}
备注
13 pages