中文

寻找生成式文本到图像模型中的逻辑:关系、否定与数字

计算机视觉与模式识别 2024-11-27 v1 计算与语言 符号计算

摘要

尽管多模态AI研究取得了显著进展,但在现代AI甚至人类儿童仍显著滞后的领域仍然存在明显不足,即可靠部署逻辑运算符的能力。本文考察了三种形式的逻辑运算符:关系、否定和离散数字。我们要求人类受访者(共计N=178人)评估由DALL-E 3等最先进图像生成AI生成的图像,这些图像是针对包含这些“逻辑探针”的提示生成的,并且发现没有一种方法能产生超过50%的人类一致性得分。否定探针和超过3的数字失败得最厉害。在第4次实验中,我们评估了一种“ grounding diffusion”管道,该管道利用针对性提示工程和结构化中间表示以获得更好的组合控制,但发现其性能在DALL-E 3之外的提示下甚至更差。为进一步阐明这些文本到图像系统在成功与失败方面的潜在来源,本文补充了4项核心实验和多项辅助分析和示意图,定量衡量,例如关系提示N-gram频率与生成图像平均匹配度之间的关系;不同提示修改策略在渲染否定提示时的成功率;以及涉及整数的标量可变性/比值依赖(“近似数感知”)的提示。我们得出结论,讨论那些依赖向量语义(如DALL-E 3)或不明确语法约束(如grounded diffusion)的“grounded”多模态学习系统的局限性,并提出受发展启发、基于隐喻的最小性修改,以弥合规模与结构之间的持续的组合鸿沟。所有数据和代码均可在 https://github.com/ColinConwell/T2I-Probology 获取。

关键词

引用

@article{arxiv.2411.17066,
  title  = {Relations, Negations, and Numbers: Looking for Logic in Generative Text-to-Image Models},
  author = {Colin Conwell and Rupert Tawiah-Quashie and Tomer Ullman},
  journal= {arXiv preprint arXiv:2411.17066},
  year   = {2024}
}