中文

迈向透明 AI 系统:解释视觉问答模型

计算机视觉与模式识别 2016-09-12 v2 人工智能 计算与语言 机器学习

摘要

近年来,深度神经网络取得了显著进展,并在许多 AI 研究领域获得了最先进的结果。然而,不知道它们为何做出这样的预测常常令人不满意。在本文中,我们解决了解释视觉问答(VQA)模型的问题。具体来说,我们感兴趣的是找出 VQA 模型在回答问题时关注输入的哪一部分(图像中的像素或问题中的单词)。为了解决这个问题,我们使用两种可视化技术——引导反向传播和遮挡——来寻找问题中的重要单词和图像中的重要区域。然后,我们呈现了对这些重要性图的定性和定量分析。我们发现,即使没有显式的注意力机制,VQA 模型有时也可能隐式地关注图像中的相关区域,并且常常关注问题中的适当单词。

关键词

引用

@article{arxiv.1608.08974,
  title  = {Towards Transparent AI Systems: Interpreting Visual Question Answering Models},
  author = {Yash Goyal and Akrit Mohapatra and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1608.08974},
  year   = {2016}
}