多模态深度网络中 Hadamard 乘积的视觉解释
计算机视觉与模式识别
2017-12-19 v1 人工智能
机器学习
摘要
对模型所学表示的视觉解释有助于理解学习的基本原理。以往工作的注意力模型利用所学权重可视化图像或文本上的关注区域,以确认其预期机制。Kim 等人(2016)表明,多模态深度网络中众所周知的用于视觉问答任务联合函数的 Hadamard 乘积,对视觉输入隐式地执行了注意力机制。在本文中,我们扩展他们的工作,表明多模态深度网络中的 Hadamard 乘积不仅针对视觉输入,还利用所提出的基于梯度的可视化技术同时针对文本输入执行注意力机制。通过分析两个输入与 Hadamard 乘积的输出,用所提方法可视化了 Hadamard 乘积对视觉和文本输入的注意力效应,并与视觉问答模型的所学注意力权重进行了比较。
引用
@article{arxiv.1712.06228,
title = {Visual Explanations from Hadamard Product in Multimodal Deep Networks},
author = {Jin-Hwa Kim and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1712.06228},
year = {2017}
}
备注
8 pages, 5 figures, including appendix, NIPS 2017 Workshop on Visually-Grounded Interaction and Language (ViGIL)