中文

GeReA:面向知识型视觉问答的问题感知提示字幕

计算机视觉与模式识别 2024-02-07 v1 计算与语言

摘要

知识型视觉问答(VQA)需要图像之外的世界知识才能获得准确答案。最近,不再使用额外的知识库,而是将像 GPT-3 这样的大语言模型(LLM)激活为隐式知识引擎,通过将图像转换为文本信息(例如,字幕和答案候选),来联合获取并推理回答所需的知识。然而,这种转换可能会引入无关信息,导致 LLM 误解图像并忽略对准确知识至关重要的视觉细节。我们认为,多模态大语言模型(MLLM)凭借其卓越的视觉理解能力,是比 LLM 更好的隐式知识引擎。尽管如此,如何激活 MLLM 作为隐式知识引擎的能力尚未得到探索。因此,我们提出了 GeReA,这是一个生成-推理框架,它利用与问题相关的视觉和语言信息提示像 InstructBLIP 这样的 MLLM,生成与知识相关的描述,并对这些描述进行推理以用于知识型 VQA。具体而言,与问题相关的图像区域和特定问题的人工提示在 MLLM 中被编码以生成与知识相关的描述,称为问题感知提示字幕。之后,问题感知提示字幕、图像-问题对以及相似样本被送入多模态推理模型,以学习用于答案预测的联合知识-图像-问题表示。GeReA 解锁了 MLLM 作为隐式知识引擎的使用,在 OK-VQA 和 A-OKVQA 数据集上超越了所有先前最先进的方法,测试准确率分别达到 66.5% 和 63.3%。我们的代码将在 https://github.com/Upper9527/GeReA 发布。

关键词

引用

@article{arxiv.2402.02503,
  title  = {GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering},
  author = {Ziyu Ma and Shutao Li and Bin Sun and Jianfei Cai and Zuxiang Long and Fuyan Ma},
  journal= {arXiv preprint arXiv:2402.02503},
  year   = {2024}
}

备注

17 pages