中文

基于推理路径的开放集知识视觉问答

机器学习 2023-10-13 v1

摘要

给定一张图像与一个关联文本问题,基于知识的视觉问答(KB-VQA)旨在借助外部知识库对问题给出正确回答。先前的 KB-VQA 模型通常被构建为检索器-分类器框架,其中预训练检索器从知识图谱中提取文本或视觉信息,随后在候选中做出预测。尽管取得可喜进展,现有模型存在两点不足。首先,将问答建模为多类分类将答案空间限制于预设语料库,缺乏灵活推理能力。其次,分类器仅考虑“答案是什么”而不考虑“如何得到答案”,无法将答案锚定到显式推理路径。本文直面\emph{可解释开放集} KB-VQA 的挑战,该系统需以开放世界中的实体回答问题并保留可解释的推理路径。为解决上述问题,我们提出一种新的 KB-VQA 检索器-排序器范式,即图路径排序器(简称 GATHER)。具体而言,它包含图构建、剪枝与路径级排序,不仅检索准确答案,还提供解释推理过程的推理路径。为全面评估模型,我们以人工校正的实体级标注重构基准数据集 OK-VQA,并发布为 ConceptVQA。在真实世界问题上的大量实验表明,我们的框架不仅能够跨整个知识库进行开放集问答,还能提供显式推理路径。

关键词

引用

@article{arxiv.2310.08148,
  title  = {Open-Set Knowledge-Based Visual Question Answering with Inference Paths},
  author = {Jingru Gan and Xinzhe Han and Shuhui Wang and Qingming Huang},
  journal= {arXiv preprint arXiv:2310.08148},
  year   = {2023}
}