组合与变形:用文本到图像模型度量意象性
计算与语言
2024-12-30 v1 计算机视觉与模式识别
摘要
尽管心理语言学家与心理学家长期研究语言串在听者或读者中引发心理图像的倾向,多数计算研究仅将此意象性概念应用于孤立单词。利用文本到图像生成模型(如 DALLE mini)的近期进展,我们提出使用生成图像来度量单个英文单词与连贯文本的意象性的计算方法。我们从三个语料库采样文本提示以生成图像:人工生成的图片描述、新闻句子与诗歌行。我们对这些提示施加不同变形(deformance),以检验模型检测由组合变化引起的意象性改变的能力。我们发现所提出的意象性计算度量与人类对单个单词的判断高度相关。我们还发现相较基线方法,所提度量对组合性变化响应更为一致。我们讨论了模型训练的潜在影响及对文本到图像模型中组合性研究的意义。
引用
@article{arxiv.2306.03168,
title = {Composition and Deformance: Measuring Imageability with a Text-to-Image Model},
author = {Si Wu and David A. Smith},
journal= {arXiv preprint arXiv:2306.03168},
year = {2024}
}