选择、替换、搜索:知识增强视觉问答的新基准
计算机视觉与模式识别
2021-08-11 v3 机器学习
摘要
涵盖文本语料库、知识图与图像的多模态信息检索,称为外部知识视觉问答(OKVQA),近来备受关注。然而,流行数据集存在严重局限。惊人比例的大量查询并未评估跨模态信息整合能力。相反,部分与图像无关,部分依赖推测,部分需要 OCR 或可仅从图像本身作答。除上述局限外,基于频率的猜测因训练与测试折之间(非预期的)广泛答案重叠而非常有效。总体而言,由于最先进系统不透明且其“推理”过程不可解释,难以判断其何时利用了这些弱点而非真正推断答案。同样重要的局限是,该数据集仅设计用于端到端答案检索任务的定量评估,未提供对输入查询正确(语义)解释的评估手段。对此,我们识别出 OKVQA 中的关键结构惯用语,即 S3(选择、替换与搜索),并围绕其构建新数据集与挑战。具体而言,提问者识别图像中实体并就涉及该实体的问题提问,该问题只能借助提及该实体的知识图或语料库段落来回答。我们的挑战包括(i)基于该结构惯用语标注的 OKVQA 子集 OKVQAS3,以及(ii)从头构建的新数据集 S3VQA。我们还提出了一个神经但结构透明的 OKVQA 系统 S3,它明确应对我们的挑战数据集,并优于近期竞争性基线。
引用
@article{arxiv.2103.05568,
title = {Select, Substitute, Search: A New Benchmark for Knowledge-Augmented Visual Question Answering},
author = {Aman Jain and Mayank Kothyari and Vishwajeet Kumar and Preethi Jyothi and Ganesh Ramakrishnan and Soumen Chakrabarti},
journal= {arXiv preprint arXiv:2103.05568},
year = {2021}
}
备注
Accepted at SIGIR 2021