中文

BOK-VQA:基于图表示预训练的双语外部知识视觉问答

计算与语言 2024-08-01 v2

摘要

当前生成模型(如最近开发的GPT4)的研究方向旨在为多模态和多语言输入寻找相关知识信息以提供答案。在此研究背景下,对多模态系统代表性任务——视觉问答(VQA)任务的多语言评估需求增加。因此,我们在本研究中提出了一个可扩展到多语言的双语外部知识VQA(BOK-VQA)数据集。所提出的数据包括17K张图像、17K个韩语和英语的问题-答案对,以及28万个与问题-答案内容相关的知识信息实例。我们还提出了一个框架,通过以图嵌入的形式预训练BOK-VQA数据的知识信息,从而有效地将知识信息注入VQA系统。最后,通过深入分析,我们展示了构建的训练数据中包含的知识信息对VQA的实际效果。

关键词

引用

@article{arxiv.2401.06443,
  title  = {BOK-VQA: Bilingual outside Knowledge-Based Visual Question Answering via Graph Representation Pretraining},
  author = {Minjun Kim and Seungwoo Song and Youhan Lee and Haneol Jang and Kyungtae Lim},
  journal= {arXiv preprint arXiv:2401.06443},
  year   = {2024}
}