中文

SCRA-VQA:用于增强型大型语言模型在视觉问答中的摘要标题重排

计算机视觉与模式识别 2025-09-26 v1 人工智能

摘要

获取高质量知识是基于知识的视觉问答(KB-VQA)的核心焦点。近期方法使用大型语言模型(LLM)作为知识引擎进行回答。这些方法通常采用图像标题作为视觉文本描述,以辅助LLM理解图像。然而,标题经常包含与问题无关的过多噪声,且LLM通常不理解VQA任务,限制了其推理能力。为此,我们提出摘要标题重排增强VQA(SCRA-VQA),它使用预训练的视觉语言模型将图像转换为标题。此外,SCRA-VQA为标题生成上下文示例,同时对它们进行摘要和重排,以排除无关信息。标题重排过程使LLM更好地理解图像信息和问题,从而增强模型的推理能力和任务适应性,而无需昂贵的端到端训练。基于一个具有67亿参数的LLM,SCRA-VQA在两个具有挑战性的基于知识的VQA数据集上表现出色:OK-VQA和A-OKVQA,准确率分别为38.8%和34.6%。我们的代码可在https://github.com/HubuKG/SCRA-VQA获取。

关键词

引用

@article{arxiv.2509.20871,
  title  = {SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering},
  author = {Yan Zhang and Jiaqing Lin and Miao Zhang and Kui Xiao and Xiaoju Hou and Yue Zhao and Zhifei Li},
  journal= {arXiv preprint arXiv:2509.20871},
  year   = {2025}
}

备注

ACCEPTED as a FULL PAPER for the Research Track at International Conference on Database Systems for Advanced Applications 2025