中文

眼见为实!基于知识图谱嵌入的事实型视觉问答

计算与语言 2021-06-22 v2 机器学习

摘要

事实型视觉问答(FVQA)是视觉问答(VQA)的一个具有挑战性的变体,要求问答系统在推理过程中纳入来自多样化知识图谱(KG)的事实以生成答案。大型知识图谱,尤其是常识知识图谱,已知是不完整的,即并非所有不存在的事实都是错误的。因此,能够在不完整知识图谱上进行推理以用于问答是现实应用中的一项关键需求,而文献中尚未对此进行广泛研究。我们提出了一种新颖的问答架构,能够对不完整知识图谱进行推理,这是当前FVQA最优(SOTA)方法所缺乏的,因为它们严重依赖事实检索。我们将广泛用于知识图谱补全的KG嵌入(KG Embeddings)技术用于FVQA这一下游任务。我们还采用了一种称为“图像即知识”(Image-as-Knowledge)的新图像表示技术来实现该能力,并辅以一个简单的单步协同注意力(CoAttention)机制,在问答过程中关注文本与图像。我们的FVQA架构在推理时更快,复杂度为O(m),而现有FVQA SOTA方法的复杂度为O(N log N),其中m为顶点数,N为边数=O(m^2)。研究表明,KG嵌入与词嵌入具有互补信息:两种度量的结合在标准答案检索任务中可达到与SOTA方法相当的性能,而在所提出的缺失边推理任务中显著更优(绝对提升26%)。

关键词

引用

@article{arxiv.2012.15484,
  title  = {Seeing is Knowing! Fact-based Visual Question Answering using Knowledge Graph Embeddings},
  author = {Kiran Ramnath and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2012.15484},
  year   = {2021}
}

备注

17 pages