词与图像之间的联系有多直接?
计算与语言
2023-11-01 v2
摘要
当前的词嵌入模型尽管成功,仍受其缺乏真实世界接地(grounding)所困。在此研究脉络下,Gunther 等人(2022)提出一项行为实验以考察词与图像的关系。在其设置中,向参与者呈现一个目标名词与一对图像,一张由其模型选出,另一张随机选出。参与者被要求选择最匹配目标名词的图像。多数情况下参与者偏好模型所选图像。因此,Gunther 等人得出结论,词与具身经验之间存在直接联系的可能。我们以该实验为出发点,探讨以下问题:1. 除利用给定图像的视觉具身模拟外,受试者还可能使用何种其他策略解决此任务?该设置对图像视觉信息的依赖程度如何?能否仅用纯文本表征解决?2. 当前视觉接地嵌入是否比文本嵌入更好地解释受试者的选择行为?3. 视觉接地是否改善具体词与抽象词的语义表征?为回答这些问题,我们使用预训练的文本与视觉接地词嵌入设计了新颖实验。我们的实验揭示,受试者的选择行为在很大程度上可由纯基于文本的嵌入与基于词的相似性解释,表明主动具身经验的参与甚少。视觉接地嵌入仅在特定情况下较文本嵌入有 modest 优势。这些发现表明,Gunther 等人的实验可能并不适合触及参与者的感知经验,因此其衡量视觉接地知识的程度不清。
引用
@article{arxiv.2206.15381,
title = {How direct is the link between words and images?},
author = {Hassan Shahmohammadi and Maria Heitmeier and Elnaz Shafaei-Bajestan and Hendrik P. A. Lensch and Harald Baayen},
journal= {arXiv preprint arXiv:2206.15381},
year = {2023}
}
备注
Accepted in the Mental Lexicon Journal: https://benjamins.com/catalog/ml