中文

自监督视觉Transformer中类人注意力的涌现:一项眼动追踪研究

神经元与认知 2025-05-28 v1

摘要

迄今为止已提出许多视觉注意力模型。传统自下而上的模型,如显著性模型,无法复制人类注视模式,而深度注视预测模型由于依赖监督学习而缺乏生物学合理性。视觉Transformer(ViT)凭借其自注意力机制提供了一种新方法,但若使用监督学习训练往往产生分散的注意力模式。本研究探讨了自监督DINO(无标签自蒸馏)训练是否能使ViT发展出类似于人类视觉注意力的机制。使用视频刺激捕捉人类注视动态,我们发现DINO训练的ViT紧密模仿人类注意力模式,而使用监督学习训练的ViT则显著偏离。对自注意力头的分析揭示了三个不同的簇:一个聚焦于前景对象,一个聚焦于整个对象,一个聚焦于背景。DINO训练的ViT为人类外显注意和图形-背景分离在视觉感知中如何发展提供了见解。

关键词

引用

@article{arxiv.2410.22768,
  title  = {Emergence of Human-Like Attention in Self-Supervised Vision Transformers: an eye-tracking study},
  author = {Takuto Yamamoto and Hirosato Akahoshi and Shigeru Kitazawa},
  journal= {arXiv preprint arXiv:2410.22768},
  year   = {2025}
}