中文

面向视觉问答的忠实多模态解释

计算与语言 2019-06-05 v2 计算机视觉与模式识别

摘要

AI系统解释其推理过程的能力对其效用与可信度至关重要。深度神经网络在许多具有挑战性的问题上(如视觉问答(VQA))取得了显著进展。然而,它们大多是透明度有限的黑箱,解释能力薄弱。本文提出一种新方法,构建高性能VQA系统,该系统能够通过集成的文本与视觉解释来阐明其答案,这些解释忠实反映其底层推理的重要方面,同时捕捉易懂的人类解释风格。大量实验评估表明,相较于对比方法,该方法在自动评价指标与人工评价指标上均具优势。

关键词

引用

@article{arxiv.1809.02805,
  title  = {Faithful Multimodal Explanation for Visual Question Answering},
  author = {Jialin Wu and Raymond J. Mooney},
  journal= {arXiv preprint arXiv:1809.02805},
  year   = {2019}
}

备注

In ACL 2019 BlackboxNLP workshop