中文

KRISP:融合隐式与符号知识用于开放域基于知识的视觉问答

计算机视觉与模式识别 2020-12-22 v1 计算与语言

摘要

VQA 中最具挑战性的问题类型之一是回答需要图像之外知识的问题。本工作中我们研究开放域知识,即回答问题所需知识在训练与测试时均未被给定/标注的设置。我们利用两类知识表示与推理。第一,隐式知识,可通过无监督语言预训练与基于 transformer 模型的监督训练数据有效学习。第二,编码于知识库中的显式符号知识。我们的方法将两者结合——利用 transformer 模型强大的隐式推理进行答案预测,并集成来自知识图的符号表示,同时绝不将其显式语义丢失为隐式嵌入。我们结合多样知识源以覆盖解决基于知识问题所需的广泛知识。我们展示我们的方法 KRISP(Knowledge Reasoning with Implicit and Symbolic rePresentations,基于隐式与符号表示的知识推理)在最大的开放域基于知识的 VQA 数据集 OK-VQA 上显著优于 SOTA。我们通过大量消融实验表明,尽管我们的模型成功利用了隐式知识推理,但显式连接知识图与答案词表的符号答案模块对我们方法的性能至关重要,并能泛化至罕见答案。

关键词

引用

@article{arxiv.2012.11014,
  title  = {KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA},
  author = {Kenneth Marino and Xinlei Chen and Devi Parikh and Abhinav Gupta and Marcus Rohrbach},
  journal= {arXiv preprint arXiv:2012.11014},
  year   = {2020}
}