面向视觉问答的鲁棒解释
计算机视觉与模式识别
2020-01-24 v1 人工智能
计算与语言
机器学习
多媒体
摘要
本文提出一种为视觉问答(VQA)获取与答案高度相关的鲁棒解释的方法。我们的模型通过提供视觉与文本解释,来解释VQA模型所得答案。我们解决的主要挑战是:i) 现有方法得到的答案与文本解释相关性不佳;ii) 现有视觉解释方法未聚焦于解释答案的正确位置。我们通过使用协同相关模块解决这两类挑战,该模块确保即使我们不针对基于噪声的攻击进行训练,增强的相关性也能保证生成正确的解释与答案。我们进一步表明这也有助于改进生成的视觉与文本解释。该相关模块的使用可视为验证答案与解释是否一致的鲁棒方法。我们使用VQA-X数据集评估此模型。我们观察到所提方法产生了更好的支持决策的文本与视觉论证。我们利用相应的视觉与文本解释展示了模型针对基于噪声的扰动攻击的鲁棒性。文中给出了详细的实证分析。此处提供我们模型的源代码链接 \url{https://github.com/DelTA-Lab-IITK/CCM-WACV}。
引用
@article{arxiv.2001.08730,
title = {Robust Explanations for Visual Question Answering},
author = {Badri N. Patro and Shivansh Pate and Vinay P. Namboodiri},
journal= {arXiv preprint arXiv:2001.08730},
year = {2020}
}
备注
WACV-2020 (Accepted)