中文

面向训练上下文增强型多模态LLM的规模化合成知识生成:SK-VQA

计算与语言 2025-06-11 v2 计算机视觉与模式识别

摘要

多模态检索增强生成(RAG)在诸多领域发挥着关键作用,例如知识库视觉问答(KB-VQA),其中需要外部知识来回答问题。然而,现有的多模态大语言模型(MLLM)未为上下文增强生成而设计,限制了其在此类任务中的效能。虽然近期注意力转向合成数据生成以训练MLLM,但其在上下文增强生成方面的应用仍鲜有探索。为填补这一空白,我们引入SK-VQA,一个大规模合成多模态数据集,包含超过200万个视觉问答对,每组数据均关联包含确定最终答案所需信息的上下文文档。与之前的数据集相比,SK-VQA包含11倍以上的唯一问题,具有更广泛的领域多样性,覆盖更广泛的图像来源。通过人类评估,我们确认所生成的问答对质量高且上下文相关性强。广泛的实验表明,SK-VQA既是挑战性的KB-VQA基准,也是适用于MLLM进行上下文增强生成的有效训练资源。我们的结果进一步表明,基于SK-VQA训练的模型在上下文感知VQA和多模态RAG设置中表现出增强的泛化能力。SK-VQA已通过Hugging Face Hub公开获取。

关键词

引用

@article{arxiv.2406.19593,
  title  = {SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs},
  author = {Xin Su and Man Luo and Kris W Pan and Tien Pei Chou and Vasudev Lal and Phillip Howard},
  journal= {arXiv preprint arXiv:2406.19593},
  year   = {2025}
}

备注

ICML 2025 Spotlight Oral