通过实体增强知识注入改进与诊断基于知识的视觉问答
计算与语言
2022-05-30 v1 计算机视觉与模式识别
机器学习
摘要
基于知识的视觉问答(KBVQA)是一项双模态任务,需要外部世界知识才能正确回答文本问题及关联图像。近期单模态文本工作表明,将知识注入预训练语言模型(具体为实体增强知识图谱嵌入)可提升下游以实体为中心任务的性能。在本工作中,我们实证研究了此类方法在双模态设定下应用能否及如何提升现有 VQA 系统在 KBVQA 任务上的表现。我们在两个大型公开 VQA 数据集上实验:(1)KVQA,包含大多为罕见的维基百科实体;(2)OKVQA,其以实体为中心的程度较低且更贴近常识推理。两者均缺乏显式实体跨度,我们研究了获取这些跨度的不同弱监督与人工方法的效果。此外,我们分析了近期提出的双模态与单模态注意力解释如何受此类实体增强表示的引入影响。我们的结果显示,在 KBVQA 任务上性能获得显著提升,且无需额外昂贵的预训练,并我们就实体知识注入何时有助于提升模型理解提供了见解。我们提供代码与增强数据集以保证可复现性。
引用
@article{arxiv.2112.06888,
title = {Improving and Diagnosing Knowledge-Based Visual Question Answering via Entity Enhanced Knowledge Injection},
author = {Diego Garcia-Olano and Yasumasa Onoe and Joydeep Ghosh},
journal= {arXiv preprint arXiv:2112.06888},
year = {2022}
}