DALLE-2 的双重错觉:文本到图像模型中词到概念映射的缺陷
计算与语言
2022-10-20 v1 机器学习
摘要
我们研究 DALLE-2 将提示中的符号(词)映射到其指称(生成图像中的实体或实体属性)的方式。我们表明,与人类处理语言的方式形成鲜明对比,DALLE-2 不遵循每个词在解释中仅有单一角色的约束,有时将同一符号复用于不同目的。我们收集了一组反映该现象的 stimuli:我们展示 DALLE-2 同时描绘具有多义名词的两种意义;且给定词可修改图像中两个不同实体的属性,或可被描绘为一个对象并同时修改另一对象的属性,从而在实体间产生属性的语义泄漏。综上,我们的研究凸显了 DALLE-2 与人类语言处理的差异,并为未来关于文本到图像模型归纳偏置的研究开辟了途径。
引用
@article{arxiv.2210.10606,
title = {DALLE-2 is Seeing Double: Flaws in Word-to-Concept Mapping in Text2Image Models},
author = {Royi Rassin and Shauli Ravfogel and Yoav Goldberg},
journal= {arXiv preprint arXiv:2210.10606},
year = {2022}
}
备注
5 pages, BlackboxNLP @ EMNLP 2022