中文

SURf: 教大型视觉语言模型选择性利用检索信息

计算机视觉与模式识别 2024-09-24 v1

摘要

大型视觉语言模型(LVLMs)已成为计算机视觉与自然语言处理交叉领域的核心。然而,LVLMs检索增强生成(RAG)能力的全部潜力仍未被充分利用。现有工作要么仅关注文本模态,要么局限于特定任务。此外,大多数LVLMs难以选择性利用检索信息,并且对无关或误导性参考敏感。为了应对这些挑战,我们提出了一个自我精炼框架,旨在教导LVLMs选择性利用检索信息(SURf)。具体而言,当给定LVLM骨干网络错误回答的问题时,我们获取有助于纠正答案的参考(正参考)和无助于纠正答案的参考(负参考)。然后,我们使用这些正参考和负参考的组合对LVLM骨干网络进行微调。我们在三个任务和七个数据集上的实验表明,我们的框架显著增强了LVLMs有效利用检索多模态参考的能力,并提高了其对无关或误导信息的鲁棒性。源代码可在https://github.com/GasolSun36/SURf获取。

关键词

引用

@article{arxiv.2409.14083,
  title  = {SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information},
  author = {Jiashuo Sun and Jihai Zhang and Yucheng Zhou and Zhaochen Su and Xiaoye Qu and Yu Cheng},
  journal= {arXiv preprint arXiv:2409.14083},
  year   = {2024}
}

备注

19 pages, 9 tables, 11 figures