中文

VISREAS:带不可解问题的复杂视觉推理

计算机视觉与模式识别 2024-03-19 v1 人工智能

摘要

在现实应用中,验证问题的有效性再回答问题至关重要,因为用户可能提供不完美的指令。在此情境下,理想模型应解决查询中的差异并向用户传达这些差异,而非生成最佳可能的答案。为此,我们引入了一个新的组合式视觉问答数据集 VISREAS,包含由遍历和扰动对象、属性和关系之间的常见性与差异性所构成的可回答与不可回答视觉查询。VISREAS 包含 207 万个由 Visual Genome 场景图自动生成的语义多样化查询。该任务的独特特征是针对图像在回答问题前验证问题的可解性,而现有先进模型的性能较差,促使我们设计了一种新的模块化基线 LOGIC2VISION,通过生成和执行伪代码来进行推理,而无需任何外部模块来生成答案。LOGIC2VISION 在 VISREAS 上超越生成模型(相对于 LLaVA-1.5 提升 4.82%;相对于 InstructBLIP 提升 12.23%),并在分类模型中实现显著性能提升。

关键词

引用

@article{arxiv.2403.10534,
  title  = {VISREAS: Complex Visual Reasoning with Unanswerable Questions},
  author = {Syeda Nahida Akter and Sangwu Lee and Yingshan Chang and Yonatan Bisk and Eric Nyberg},
  journal= {arXiv preprint arXiv:2403.10534},
  year   = {2024}
}

备注

18 pages, 14 figures, 5 tables