中文

Prophet:以互补答案启发式提示大语言模型的知识型视觉问答框架

计算机视觉与模式识别 2025-04-30 v4 计算与语言 机器学习

摘要

知识型视觉问答(VQA)需要图像之外的外部知识来回答问题。早期研究从显式知识库(KBs)中检索所需知识,这常向问题引入无关信息,从而限制了其模型的性能。近期工作转而使用强大的大语言模型(LLM)作为隐式知识引擎来获取回答所需的知识。尽管这些方法取得了令人鼓舞的结果,我们认为它们尚未充分激活该\emph{盲} LLM 的能力,因为所提供的文本输入不足以刻画回答该问题所需的视觉信息。本文中,我们提出 Prophet——一个概念上简单、灵活且通用的框架,旨在通过答案启发式提示 LLM 以用于知识型 VQA。具体而言,我们首先在特定知识型 VQA 数据集上训练一个无外部知识的原始 VQA 模型。此后,我们从该 VQA 模型提取两类互补的答案启发式:答案候选与答案感知示例。这两类答案启发式被联合编码为格式化提示,以促进 LLM 对图像与问题的理解,从而生成更准确的答案。通过结合最先进的 LLM GPT-3,Prophet 在四个具有挑战性的知识型 VQA 数据集上显著优于现有最先进方法。Prophet 具有通用性,可用不同 VQA 模型(即判别式与生成式)与不同 LLM(即商业与开源)的组合来实例化。此外,Prophet 也可在不同阶段与现代大型多模态模型集成,称为 Prophet++,以进一步提升在知识型 VQA 任务上的能力。

关键词

引用

@article{arxiv.2303.01903,
  title  = {Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering},
  author = {Zhou Yu and Xuecheng Ouyang and Zhenwei Shao and Meng Wang and Jun Yu},
  journal= {arXiv preprint arXiv:2303.01903},
  year   = {2025}
}

备注

An extended journal version of our CVPR 2023 paper, which has been accepted at IEEE T-PAMI 2025. The original conference version can be referred to as the v1 version