中文

通过问题驱动的图像描述作为提示增强视觉问答

计算机视觉与模式识别 2024-04-15 v1 人工智能

摘要

视觉问答(VQA)被认为是一项AI完备的任务,因为它需要对视觉和语言内容进行理解、推理和推断。在过去的几年里,针对VQA问题提出了许多神经网络架构。然而,由于需要高级的泛化和推理能力,在零样本VQA中取得成功仍然是一个挑战。本研究探讨了在VQA流程中引入图像描述作为中间过程的影响。具体而言,我们探索了利用图像描述代替图像,并利用大语言模型(LLM)建立零样本设置的有效性。由于图像描述是该过程中最关键的步骤,我们比较了最先进的图像描述模型在不同结构和语义的问题类型下对VQA性能的影响。我们在该流程中提出了一种简单有效的问题驱动的图像描述方法,以将上下文信息传递给问答(QA)模型。该方法包括从问题中提取关键词,利用关键词为每个图像-问题对生成描述,并将问题驱动的描述纳入LLM提示中。我们评估了在VQA流程中使用通用图像描述和问题驱动图像描述的有效性。我们的研究突出了在零样本设置下采用图像描述并利用LLM的能力在GQA上实现具有竞争力的性能的潜力。我们的代码可在 \url{https://github.com/ovguyo/captions-in-VQA} 获取。

关键词

引用

@article{arxiv.2404.08589,
  title  = {Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts},
  author = {Övgü Özdemir and Erdem Akagündüz},
  journal= {arXiv preprint arXiv:2404.08589},
  year   = {2024}
}

备注

The paper has been accepted for presentation at CVPR 2024 Workshop on Prompting in Vision