面向视觉问答的忠实多模态解释
计算与语言
2019-06-05 v2 计算机视觉与模式识别
摘要
AI系统解释其推理过程的能力对其效用与可信度至关重要。深度神经网络在许多具有挑战性的问题上(如视觉问答(VQA))取得了显著进展。然而,它们大多是透明度有限的黑箱,解释能力薄弱。本文提出一种新方法,构建高性能VQA系统,该系统能够通过集成的文本与视觉解释来阐明其答案,这些解释忠实反映其底层推理的重要方面,同时捕捉易懂的人类解释风格。大量实验评估表明,相较于对比方法,该方法在自动评价指标与人工评价指标上均具优势。
引用
@article{arxiv.1809.02805,
title = {Faithful Multimodal Explanation for Visual Question Answering},
author = {Jialin Wu and Raymond J. Mooney},
journal= {arXiv preprint arXiv:1809.02805},
year = {2019}
}
备注
In ACL 2019 BlackboxNLP workshop