中文

面向外部知识视觉问答的实体聚焦稠密段落检索

计算与语言 2022-10-24 v2 计算机视觉与模式识别

摘要

大多数外部知识视觉问答(OK-VQA)系统采用两阶段框架:首先根据视觉问题检索外部知识,然后基于检索内容预测答案。然而,检索到的知识往往不充分。检索结果常常过于笼统,未能覆盖回答问题所需的特定知识。此外,自然可用的监督信号(段落是否包含正确答案)较弱,无法保证问题与段落的相关性。为解决这些问题,我们提出一种实体聚焦检索(EnFoRe)模型,在训练时提供更强的监督,并识别与问题相关的实体以帮助检索更具体的知识。实验表明,我们的 EnFoRe 模型在 OK-VQA(当前最大的外部知识 VQA 数据集)上取得了优越的检索性能。我们还将检索到的知识与 SOTA VQA 模型结合,在 OK-VQA 上达到了新的 SOTA 性能。

关键词

引用

@article{arxiv.2210.10176,
  title  = {Entity-Focused Dense Passage Retrieval for Outside-Knowledge Visual Question Answering},
  author = {Jialin Wu and Raymond J. Mooney},
  journal= {arXiv preprint arXiv:2210.10176},
  year   = {2022}
}

备注

EMNLP 2022