SADL:面向组合视觉问答的有效 in-context 学习方法
计算机视觉与模式识别
2024-07-03 v1
摘要
大型视觉语言模型 (LVLMs) 提供了一种新的能力,用于在视觉问答中进行 in-context 学习 (ICL)。当以少量 image-question-answer 三元组的示范性提示时,LVLMs 已展示出 discern 隐藏模式并将此知识传递给对未见图像的问题进行回答的能力,无需进行高昂的监督式 fine-tuning。然而,设计有效的视觉语言提示,尤其是针对组合问题,仍不受良好理解。仅采用语言的 ICL 技巧可能并不一定奏效,因为我们需要搭建视觉-语言语义之间的鸿沟:符号概念必须在视觉内容中实现锚定,而这些内容并不共享语法语言结构。本文引入 SADL,一个新的视觉-语言提示框架用于该任务。SADL 围绕三个关键组件: SAmpling、Deliberation 和 Pseudo-Labeling image-question 对。给定 image-question 查询,我们从训练数据中抽取与查询在语义上接近的 image-question 对。为解决问题的组合性质,deliberation 步骤将复杂问题分解为子问题序列。最后,该序列逐个标记一个子问题,以生成伪标签序列。我们在 OpenFlamingo 上针对大规模视觉问答数据集 (包括 GQA、GQA-OOD、CLEVR 和 CRIC) 进行调查。评估表明,在图像邻域中进行采样、复杂问题的分解以及子问题和标签的准确配对在 SADL 中发挥关键作用。这些发现并不总是与仅语言 ICL 中发现的一致,这表明了视觉-语言环境中的新见解。
引用
@article{arxiv.2407.01983,
title = {SADL: An Effective In-Context Learning Method for Compositional Visual QA},
author = {Long Hoang Dang and Thao Minh Le and Vuong Le and Tu Minh Phuong and Truyen Tran},
journal= {arXiv preprint arXiv:2407.01983},
year = {2024}
}