中文

展示答案为何正确!基于组合时序注意力的可解释 AI 研究

计算机视觉与模式识别 2021-05-18 v1

摘要

视觉问答(VQA)模型近年来取得了显著成功。尽管 VQA 模型成功,它们大多是黑盒模型,不提供关于预测答案的推理,从而引发了其在自动驾驶系统和网络安全等安全关键领域适用性的疑问。当前最优方法未能更好地处理复杂问题,因而无法利用组合性。为最小化这些模型的黑盒效应并使其更好地利用组合性,我们提出一种动态神经网络(DMN),其能理解特定问题并从模块池中动态组装多个相对浅层的深度学习模块以形成网络。我们向这些基于深度学习的模块引入组合时序注意力以增强组合性利用。这实现了对复杂问题的更好理解,并提供了模块为何预测特定答案的推理。在 VQA2.0 和 CLEVR 两个基准数据集上的实验分析表明,我们的模型在视觉问答任务上优于以往方法,且提供了更好的推理,从而使其在安全和安保等任务关键应用中值得信赖。

关键词

引用

@article{arxiv.2105.07141,
  title  = {Show Why the Answer is Correct! Towards Explainable AI using Compositional Temporal Attention},
  author = {Nihar Bendre and Kevin Desai and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2105.07141},
  year   = {2021}
}

备注

7 pages, 4 figures, 3 tables