《快与慢》的图像描述:量化与预测视觉-语言过程中人类信号的变异
计算与语言
2024-02-05 v1 人工智能
计算机视觉与模式识别
摘要
图像属性与人类在描述图像时的行为之间存在复杂的关系。这种行为表现出充分的变异,体现在诸如眼动以及人类何时开始描述图像等人类信号中。尽管此类视觉-语言变异信号具有价值,但在当前预训练模型的训练中几乎被忽视,这促使了进一步的研究。利用一个包含同时采集的眼动追踪数据的荷兰语图像描述语料库,我们探索了视觉-语言信号变异的本质,并发现它们彼此相关。基于这一结果,我们假设变异部分源于图像属性,并探索由预训练视觉编码器编码的图像表征是否能捕捉此类变异。我们的结果表明,预训练模型在弱到中等程度上做到了这一点,这表明模型缺乏关于什么使刺激对人类而言复杂以及什么导致人类输出变异的先验知识。
引用
@article{arxiv.2402.01352,
title = {Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes},
author = {Ece Takmaz and Sandro Pezzelle and Raquel Fernández},
journal= {arXiv preprint arXiv:2402.01352},
year = {2024}
}
备注
To appear in EACL 2024