中文

为 VQA 模型生成并评估注意力区域与致错输入区域的解释

计算机视觉与模式识别 2021-10-27 v3 人工智能 计算机与社会 人机交互

摘要

注意力图作为视觉问答(VQA)中一种流行的基于热图的解释方法,旨在通过高亮模型用于推断答案的图像/问题部分来帮助用户理解模型。然而,我们看到用户常被当前注意力图可视化所误导,其指向相关区域但模型却给出错误答案。因此,我们提出错误图(Error Maps),通过高亮模型易出错的图区域来澄清错误。错误图可指示正确被关注的区域可能未被正确处理从而导致错误答案,进而提升用户对此类情形的理解。为评估我们的新解释,我们进一步引入一种模拟用户对解释理解的指标,以评估其在帮助用户理解模型正确性上的潜在助益。我们最后开展用户研究,发现我们的新解释相比基线以预期 30\% 的提升帮助用户更好理解模型正确性,且我们的代理助益指标与用户预测模型正确性的能力强烈相关(ρ>0.97\rho>0.97)。

关键词

引用

@article{arxiv.2103.14712,
  title  = {Generating and Evaluating Explanations of Attended and Error-Inducing Input Regions for VQA Models},
  author = {Arijit Ray and Michael Cogswell and Xiao Lin and Kamran Alipour and Ajay Divakaran and Yi Yao and Giedrius Burachas},
  journal= {arXiv preprint arXiv:2103.14712},
  year   = {2021}
}

备注

Applied AI Letters, Wiley, 25 October 2021