中文

基于图像描述生成的语言模型在知识型视觉问答中的有效应用

计算机视觉与模式识别 2022-09-14 v3 人工智能

摘要

在视觉语言任务(如视觉问答(VQA))中整合外部知识进行推理是一个开放问题。鉴于预训练语言模型已被证明包含世界知识,我们提出一种基于自动现成图像描述生成与预训练语言模型的单模态(仅文本)训练与推理流程。我们在一个需要外部知识的视觉问答任务(OK-VQA)上的结果表明,我们的纯文本模型优于参数量可比的预训练多模态(图像-文本)模型。相比之下,我们的模型在标准 VQA 任务(VQA 2.0)中效果较弱,这证实了我们的纯文本方法特别适用于需要外部知识的任务。此外,我们展示增大语言模型规模可显著提升其性能,我们最大的模型取得了与最先进方法可比的结果,显著优于当前多模态系统,即便这些系统已引入外部知识。我们在 OK-VQA 上的定性分析揭示,自动描述常未能捕捉图像中的相关信息,而这似乎被纯文本语言模型更好的推理能力所弥补。我们的工作为进一步提升视觉语言任务中的推理开辟了可能。

关键词

引用

@article{arxiv.2109.08029,
  title  = {Image Captioning for Effective Use of Language Models in Knowledge-Based Visual Question Answering},
  author = {Ander Salaberria and Gorka Azkune and Oier Lopez de Lacalle and Aitor Soroa and Eneko Agirre},
  journal= {arXiv preprint arXiv:2109.08029},
  year   = {2022}
}

备注

Under review. 25 pages with 4 figures