通过归因驱动洞察探究VQA模型的弱点
计算机视觉与模式识别
2020-06-17 v2 计算与语言
摘要
得益于相关大规模数据集的可用,深度神经网络在过去几年已成功用于视觉问答任务。然而这些数据集构建于人工环境,很少反映真实世界场景。近期研究将这些VQA模型有效应用于为盲人回答视觉问题。尽管取得了高准确率,这些模型似乎易受输入问题变化的影响。我们通过归因(输入对预测的影响)的视角分析流行的VQA模型以获得有价值的洞察。此外,我们利用这些洞察构造对抗攻击,以输入问题语义的微小改变对系统造成显著破坏。我们相信这将促进开发出对部署以辅助视障人士时输入可能变化更具鲁棒性的系统。
引用
@article{arxiv.2006.06637,
title = {Exploring Weaknesses of VQA Models through Attribution Driven Insights},
author = {Shaunak Halbe},
journal= {arXiv preprint arXiv:2006.06637},
year = {2020}
}
备注
Second Grand-Challenge and Workshop on Multimodal Language, ACL 2020