VisQA:透视 Transformer 中的视觉与语言推理
计算机视觉与模式识别
2021-07-21 v2 人机交互
摘要
视觉问答系统的目标是在给定输入图像的情况下回答开放式文本问题。它们是学习高层推理的试验台,主要应用于人机交互(HCI),例如为视障人士提供辅助。近期研究表明,最先进的模型往往利用训练数据中的偏差和捷径来生成答案,有时甚至不查看输入图像,而非执行所需的推理步骤。我们提出 VisQA,一个探索推理与偏差利用这一问题的可视化分析工具。它揭示了最先进神经模型的关键要素——Transformer 中的注意力图。我们的工作假说是,导致模型预测的推理步骤可从注意力分布中观察到,这对于可视化尤为有用。VisQA 的设计过程受到深度学习和视觉-语言推理领域中著名偏差例子的启发,并通过两种方式进行了评估。首先,作为机器学习、视觉与语言推理以及数据分析三个领域协作的成果,该工作增进了对用于 VQA 的神经模型偏差利用的理解,并最终通过提出一种从预言机模型迁移推理模式的方法,影响了模型的设计与训练。其次,我们也报告了 VisQA 的设计,以及针对多位专家分析模型决策过程这一目标的 VisQA 导向评估,提供了其使模型内部机制对用户可见的证据。
引用
@article{arxiv.2104.00926,
title = {VisQA: X-raying Vision and Language Reasoning in Transformers},
author = {Theo Jaunet and Corentin Kervadec and Romain Vuillemot and Grigory Antipov and Moez Baccouche and Christian Wolf},
journal= {arXiv preprint arXiv:2104.00926},
year = {2021}
}