参考外部知识的可解释视觉问答
计算机视觉与模式识别
2023-03-09 v1
摘要
我们提出一种新颖的多模态可解释 VQA 模型,能够更准确地回答问题并生成多样化解释。尽管研究者已提出若干可生成人类可读且细粒度自然语言句子以解释模型决策的方法,这些方法仅关注图像中的信息。理想情况下,模型应参考图像内外的各类信息以正确生成解释,正如我们日常使用背景知识那样。所提方法融合外部知识与多图像描述,以增加模型可用信息的多样性。本文的贡献在于构建一种使用多模态输入的可解释视觉问答模型,以提升生成结果的合理性。实验结果表明,我们的模型在回答准确率和解释合理性方面均优于 SOTA 方法。
引用
@article{arxiv.2303.04388,
title = {Interpretable Visual Question Answering Referring to Outside Knowledge},
author = {He Zhu and Ren Togo and Takahiro Ogawa and Miki Haseyama},
journal= {arXiv preprint arXiv:2303.04388},
year = {2023}
}
备注
Under review