Tell-and-Answer:基于属性与描述的可解释视觉问答
计算机视觉与模式识别
2018-01-30 v1
摘要
视觉问答(VQA)已引起计算机视觉与自然语言处理领域的共同关注。大多数现有方法采用通过预训练 CNN 表示图像、再将不可解释的 CNN 特征与问题结合预测答案的流程。尽管此类端到端模型可能报告出有前景的性能,除答案外它们很少提供关于 VQA 过程的任何洞见。本工作中,我们提议将端到端 VQA 拆解为两步:解释与推理,试图通过揭示这两步之间的中间结果来实现更具可解释性的 VQA。为此,我们首先分别利用预训练属性检测器和图像描述生成模型提取属性并生成描述,作为对图像的解释。接着,推理模块利用这些解释替代图像来推断问题答案。这种拆解的优势包括:(1) 属性与描述可反映系统从图像中提取的内容,从而能为预测答案提供某些解释;(2) 这些中间结果可帮助我们在预测答案错误时定位图像理解部分与答案推断部分的不足。我们在流行 VQA 数据集上进行了充分实验,并根据若干解释质量度量对所有结果进行剖析。我们的系统取得了与 SOTA 相当的性能,且额外具备可解释性以及随更高质量解释而进一步提升的固有能力。
引用
@article{arxiv.1801.09041,
title = {Tell-and-Answer: Towards Explainable Visual Question Answering using Attributes and Captions},
author = {Qing Li and Jianlong Fu and Dongfei Yu and Tao Mei and Jiebo Luo},
journal= {arXiv preprint arXiv:1801.09041},
year = {2018}
}