基于知识图的零样本视觉问答
人工智能
2021-10-19 v4
摘要
将外部知识引入视觉问答(Visual Question Answering, VQA)已成为重要的实际需求。现有方法大多采用流水线式方法,分别使用不同组件进行知识匹配与抽取、特征学习等。然而,此类流水线方法在某一组件表现不佳时会受到影响,导致误差传播与整体性能下降。此外,多数现有方法忽视了答案偏差问题——在真实应用中,许多答案可能在训练期间从未出现(即未见答案)。为弥补这些不足,本文提出一种使用知识图与基于掩码的学习机制的零样本 VQA 算法,以更好地融合外部知识,并为 F-VQA 数据集提出了新的基于答案的零样本 VQA 划分。实验表明,我们的方法在含有未见答案的零样本 VQA 上可达到最先进的性能,同时显著增强了现有端到端模型在常规 F-VQA 任务上的表现。
引用
@article{arxiv.2107.05348,
title = {Zero-shot Visual Question Answering using Knowledge Graph},
author = {Zhuo Chen and Jiaoyan Chen and Yuxia Geng and Jeff Z. Pan and Zonggang Yuan and Huajun Chen},
journal= {arXiv preprint arXiv:2107.05348},
year = {2021}
}
备注
accepted at the International Semantic Web Conference '21 (ISWC 2021)