中文

DALLE-2 的双重错觉:文本到图像模型中词到概念映射的缺陷

计算与语言 2022-10-20 v1 机器学习

摘要

我们研究 DALLE-2 将提示中的符号(词)映射到其指称(生成图像中的实体或实体属性)的方式。我们表明,与人类处理语言的方式形成鲜明对比,DALLE-2 不遵循每个词在解释中仅有单一角色的约束,有时将同一符号复用于不同目的。我们收集了一组反映该现象的 stimuli:我们展示 DALLE-2 同时描绘具有多义名词的两种意义;且给定词可修改图像中两个不同实体的属性,或可被描绘为一个对象并同时修改另一对象的属性,从而在实体间产生属性的语义泄漏。综上,我们的研究凸显了 DALLE-2 与人类语言处理的差异,并为未来关于文本到图像模型归纳偏置的研究开辟了途径。

关键词

引用

@article{arxiv.2210.10606,
  title  = {DALLE-2 is Seeing Double: Flaws in Word-to-Concept Mapping in Text2Image Models},
  author = {Royi Rassin and Shauli Ravfogel and Yoav Goldberg},
  journal= {arXiv preprint arXiv:2210.10606},
  year   = {2022}
}

备注

5 pages, BlackboxNLP @ EMNLP 2022