中文

绘图模糊性:基于 Winograd Schema 挑战的视觉转折

计算与语言 2024-06-04 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

大语言模型 (LLM) 在诸如 Winograd Schema 挑战 (WSC) 等任务中展现了惊人的成功,展示了先进的文本常识推理能力。然而,将这种推理应用于多模态领域仍是一大挑战,因为需要理解文本和图像的整体信息。为此,我们提出 WinoVis,一个新型数据集,旨在探测文本到图像模型在多模态上下文中对代词消歧的能力。利用 GPT-4 生成提示并采用扩散注意力归因图 (DAAM) 进行热图分析,我们提出一种新型评估框架,以隔离模型在代词消歧方面能力,脱离其他视觉处理挑战。评估连续模型版本后发现,尽管incremental advancements仍有限,Stable Diffusion 2.0 在 WinoVis 上的精确率仅为 56.7%,仅略高于随机猜测。进一步的错误分析确定了未来研究的重要方向,旨在推动文本到图像模型在其解释和与复杂视觉世界交互方面的能力。

关键词

引用

@article{arxiv.2405.16277,
  title  = {Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge},
  author = {Brendan Park and Madeline Janecek and Naser Ezzati-Jivan and Yifeng Li and Ali Emami},
  journal= {arXiv preprint arXiv:2405.16277},
  year   = {2024}
}

备注

9 pages (excluding references), accepted to ACL 2024 Main Conference