基于弱监督的先决条件视觉语言推理
计算与语言
2023-06-06 v1 人工智能
计算机视觉与模式识别
摘要
人类能够通过提取各场景相关的上下文先决条件来推断物体的功能可供性。例如,看到破碎杯子的图像时,我们可推断该先决条件阻止杯子被用于饮用。自然语言处理(NLP)中研究了利用常识先决条件的推理,其中模型显式获得上下文先决条件。然而,尚不清楚SOTA视觉语言模型(VLM)能否提取此类先决条件并据此推断物体功能可供性。本工作中,我们引入先决条件视觉语言推理与合理化(PVLIR)任务。我们提出基于三种策略检索该任务弱监督信号的学习资源,并构建了人工核验的测试集用于评估。结果揭示了SOTA VLM模型在此任务中的不足,并描绘了改进这些模型所面临挑战的路线图。
引用
@article{arxiv.2306.01753,
title = {Preconditioned Visual Language Inference with Weak Supervision},
author = {Ehsan Qasemi and Amani R. Maina-Kilaas and Devadutta Dash and Khalid Alsaggaf and Muhao Chen},
journal= {arXiv preprint arXiv:2306.01753},
year = {2023}
}