标题驱动的探索:通过类人中央凹视觉对齐图像与文本嵌入
计算机视觉与模式识别
2024-08-20 v1 人工智能
摘要
理解人类注意力对于视觉科学和人工智能至关重要。虽然已有许多模型用于自由观看,但对于任务驱动的图像探索,了解仍然较少。为解决这一问题,我们引入了 CapMIT1003,一个包含标题和点击相关图像探索的数据集,用于研究标题任务中的人类注意力。我们还提出了 NevaClip,一种零样本方法,通过结合 CLIP 模型与 NeVA 算法来预测视觉扫描路径。NevaClip 生成的注视点能够对齐中央凹视觉刺激与标题的表示。模拟的扫描路径在标题任务和自由观看任务中的合理性均优于现有的人类注意力模型。本研究加深了对人类注意力的理解,并推动了扫描路径预测模型的发展。
引用
@article{arxiv.2408.09948,
title = {Caption-Driven Explorations: Aligning Image and Text Embeddings through Human-Inspired Foveated Vision},
author = {Dario Zanca and Andrea Zugarini and Simon Dietz and Thomas R. Altstidl and Mark A. Turban Ndjeuha and Leo Schwinn and Bjoern Eskofier},
journal= {arXiv preprint arXiv:2408.09948},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2305.12380