迈向透明 AI 系统:解释视觉问答模型
计算机视觉与模式识别
2016-09-12 v2 人工智能
计算与语言
机器学习
摘要
近年来,深度神经网络取得了显著进展,并在许多 AI 研究领域获得了最先进的结果。然而,不知道它们为何做出这样的预测常常令人不满意。在本文中,我们解决了解释视觉问答(VQA)模型的问题。具体来说,我们感兴趣的是找出 VQA 模型在回答问题时关注输入的哪一部分(图像中的像素或问题中的单词)。为了解决这个问题,我们使用两种可视化技术——引导反向传播和遮挡——来寻找问题中的重要单词和图像中的重要区域。然后,我们呈现了对这些重要性图的定性和定量分析。我们发现,即使没有显式的注意力机制,VQA 模型有时也可能隐式地关注图像中的相关区域,并且常常关注问题中的适当单词。
引用
@article{arxiv.1608.08974,
title = {Towards Transparent AI Systems: Interpreting Visual Question Answering Models},
author = {Yash Goyal and Akrit Mohapatra and Devi Parikh and Dhruv Batra},
journal= {arXiv preprint arXiv:1608.08974},
year = {2016}
}