CLEVR-POC:部分可观测环境下的推理密集型视觉问答
人工智能
2024-03-06 v1
摘要
学习与推理的融合是人工智能领域的研究重点。然而,对于利用已有背景知识对部分观测场景进行推理以回答关于该场景的问题,目前鲜有关注。作为人类,我们经常利用此类知识来推断视觉问题的合理答案(通过排除所有不一致的答案)。此类知识通常以关于物体的约束形式出现,且往往具有高度的领域或环境特异性。我们提出了一个名为CLEVR-POC的新基准,用于在约束条件下的部分可观测环境中进行推理密集型视觉问答(VQA)。在CLEVR-POC中,需要利用以逻辑约束形式存在的知识,对给定部分场景中隐藏物体的问题生成合理的答案。例如,如果已知所有杯子的颜色均为红色、绿色或蓝色,且只有一个绿色杯子,那么在观察到所有其他杯子(包括那个绿色杯子)的情况下,就可以推断出被遮挡杯子的颜色为红色或蓝色。通过实验,我们观察到预训练视觉语言模型(如CLIP,约22%)和大型语言模型(LLM,如GPT-4,约46%)在CLEVR-POC上的表现不佳,这证明了在具有可用且至关重要的环境特定背景知识的推理密集型任务中,需要能够处理此类任务的框架。此外,我们的演示表明,将GPT-4等LLM与视觉感知网络和形式逻辑推理器相结合的神经符号模型在CLEVR-POC上表现出卓越的性能。
引用
@article{arxiv.2403.03203,
title = {CLEVR-POC: Reasoning-Intensive Visual Question Answering in Partially Observable Environments},
author = {Savitha Sam Abraham and Marjan Alirezaie and Luc De Raedt},
journal= {arXiv preprint arXiv:2403.03203},
year = {2024}
}
备注
17 pages, 10 images, Accepted at LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation