MuKEA:面向基于知识的视觉问答的多模态知识抽取与累积
计算机视觉与模式识别
2022-03-18 v1 多媒体
摘要
基于知识的视觉问答需要具备关联外部知识以实现开放式的跨模态场景理解的能力。现有方法的一个局限是它们仅从纯文本知识库中捕获相关知识,这类知识库仅包含由一阶谓词或语言描述表达的事实,缺乏视觉理解所需却不可或缺的复杂多模态知识。如何为视觉问答场景构建视觉相关且可解释的多模态知识,尚少有研究。本文提出 MuKEA,以显式三元组表示多模态知识,将视觉对象与事实答案通过隐式关系相关联。为弥合异质性鸿沟,我们提出三种目标损失,从互补视角学习三元组表示:嵌入结构、拓扑关系与语义空间。通过采用预训练与微调的学习策略,基础与领域特定的多模态知识被逐步累积用于答案预测。我们在两个具有知识需求挑战性的数据集 OK-VQA 和 KRVQA 上分别以 3.35% 和 6.08% 的优势超越当前最优方法(SOTA)。实验结果证明了多模态知识与现有知识库的互补增益,以及我们的端到端框架相较于现有流水线方法的优势。代码见 https://github.com/AndersonStra/MuKEA。
引用
@article{arxiv.2203.09138,
title = {MuKEA: Multimodal Knowledge Extraction and Accumulation for Knowledge-based Visual Question Answering},
author = {Yang Ding and Jing Yu and Bang Liu and Yue Hu and Mingxin Cui and Qi Wu},
journal= {arXiv preprint arXiv:2203.09138},
year = {2022}
}
备注
Accepted by CVPR2022