自引导视觉语言模型用于知识选择与问答
计算机视觉与模式识别
2024-10-10 v3
摘要
虽然大型视觉语言模型 (LVLM) 在传统视觉问答基准上显示出有前景的效果,但要解决需要多样化世界知识才能回答复杂 VQA 问题的挑战仍然具有挑战性。灵感来自自然语言处理领域的检索增强生成研究,我们使用 Dense Passage Retrieval (DPR) 检索相关知识以帮助模型回答问题。然而,DPR 在自然语言空间中进行检索,可能无法确保全面获取图像信息。因此,检索到的知识并非真正有助于回答问题,影响整个系统的性能。为此,我们提出了一种新框架,利用视觉语言模型选择 DPR 检索的关键知识并回答问题。该框架由两个模块组成:选择器和回答器,其中两个模块均由 LVLM 初始化并通过自引导进行参数高效微调:使用选择器在检索到的知识文档中查找关键知识,然后用于微调回答器以预测答案;基于回答器的预测和弱监督标签获取关键知识文档的伪标签,然后用于微调选择器以选择关键知识;循环重复。我们的框架显著提高了基线在具有挑战性的开放领域知识 VQA 基准 OK-VQA 上的性能,达到最先进的准确率 62.83%。我们的代码已公开于 https://github.com/haodongze/Self-KSel-QAns。
引用
@article{arxiv.2404.13947,
title = {Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering},
author = {Dongze Hao and Qunbo Wang and Longteng Guo and Jie Jiang and Jing Liu},
journal= {arXiv preprint arXiv:2404.13947},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main Conference