GC-KBVQA:增强基于知识的视觉问答性能的新型四阶段框架
计算与语言
2025-05-27 v1 计算机视觉与模式识别
摘要
基于知识的视觉问答(KB-VQA)方法专注于那些需要利用超出图像中明确描绘内容的信息进行推理的任务。早期方法依赖显式知识库来提供这些辅助信息。近期方法则利用大型语言模型(LLM)作为隐式知识源。尽管 KB-VQA 方法已展现出可期的结果,但其潜力仍受制约,因为提供的辅助文本可能与问题语境无关,也可能包含会误导答案预测器的无关信息。我们引入了一个名为定位字幕引导的基于知识视觉问答(GC-KBVQA)的新型四阶段框架,该框架使 LLM 能够在无需端到端多模态训练的情况下有效执行零样本 VQA 任务。创新之处包括定位问题感知的字幕生成,以超越通用描述,获得紧凑、详尽且上下文丰富的信息。这与来自外部源的知识相结合,为 LLM 创建信息丰富的提示。GC-KBVQA 能够处理各种 VQA 任务,且不需要特定任务的微调,从而通过利用通用预训练 LLM 降低了成本和部署复杂性。与竞争性 KB-VQA 方法的比较显示出显著提升的性能。我们的代码将公开。
引用
@article{arxiv.2505.19354,
title = {GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance},
author = {Mohammad Mahdi Moradi and Sudhir Mudur},
journal= {arXiv preprint arXiv:2505.19354},
year = {2025}
}