中文

面向基于知识的视觉问答的多模态答案验证

计算机视觉与模式识别 2021-12-15 v3 计算与语言

摘要

基于知识的视觉问答问题涉及回答除图像内容外还需外部知识的问题。此类知识通常以多种形式出现,包括视觉、文本与常识知识。使用更多知识源增加了检索到更多不相关或噪声事实的几率,使得理解事实并找出答案具有挑战性。为应对该挑战,我们提出利用外部知识的多模态答案验证(MAVEx),其思想是基于答案特定的知识检索来验证一组有希望的答案候选。与大多数现有方法在常含不相关事实的庞大集合中搜索答案不同,MAVEx 旨在学习如何从噪声源中提取相关知识、对每个答案候选信任哪一知识源,以及如何使用该源验证候选。我们的多模态设置首次利用了外部视觉知识(使用 Google 搜索的图像),此外还有以 Wikipedia 句子与 ConceptNet 概念形式的文本知识。我们在具挑战性的基于知识的 VQA 数据集 OK-VQA 上的实验表明,MAVEx 取得了新的 SOTA 结果。我们的代码见 https://github.com/jialinwu17/MAVEX。

关键词

引用

@article{arxiv.2103.12248,
  title  = {Multi-Modal Answer Validation for Knowledge-Based VQA},
  author = {Jialin Wu and Jiasen Lu and Ashish Sabharwal and Roozbeh Mottaghi},
  journal= {arXiv preprint arXiv:2103.12248},
  year   = {2021}
}

备注

AAAI 2022