中文

对比语言-图像预训练模型是零样本人类扫描路径预测器

计算机视觉与模式识别 2023-05-24 v2 人工智能

摘要

理解人类注意力的潜在机制是视觉科学与人工智能的共同基本挑战。尽管已有众多自由观看的计算模型被提出,但对于任务驱动的图像探索机制所知甚少。为弥补这一空白,我们提出 CapMIT1003,一个在描述任务中收集的标题与点击相关图像探索数据库。CapMIT1003 基于知名 MIT1003 基准的相同刺激图像,该基准拥有自由观看条件下的眼动追踪数据,从而为同时研究人类在两类任务下的注意力提供了良好契机。我们公开此数据集以推动该领域未来研究。此外,我们引入 NevaClip,一种结合对比语言-图像预训练(CLIP)模型与生物启发神经视觉注意(NeVA)算法的零样本视觉扫描路径预测新方法。NevaClip 通过对齐中央凹视觉刺激表征与相关标题表征,并采用梯度驱动视觉探索来生成扫描路径,从而模拟人类扫描路径。实验结果表明,在标题描述与自由观看两类任务中,NevaClip 于扫描路径合理性上均优于现有无监督人类视觉注意计算模型。进一步,我们展示用错误或误导性标题条件化 NevaClip 会导致随机行为,凸显标题引导在决策过程中的显著影响。这些发现增进了对引导人类注意力的机制的理解,并为可整合下游任务直接自上而下引导的更精细扫描路径预测计算方法铺平道路。

关键词

引用

@article{arxiv.2305.12380,
  title  = {Contrastive Language-Image Pretrained Models are Zero-Shot Human Scanpath Predictors},
  author = {Dario Zanca and Andrea Zugarini and Simon Dietz and Thomas R. Altstidl and Mark A. Turban Ndjeuha and Leo Schwinn and Bjoern Eskofier},
  journal= {arXiv preprint arXiv:2305.12380},
  year   = {2023}
}