视觉推理的以对象为中心诊断
计算机视觉与模式识别
2020-12-22 v1 人工智能
计算与语言
机器学习
摘要
在回答关于图像的问题时,不仅需要知道是什么——理解图像中的细粒度内容(如对象、关系),还需要说明为什么——基于视觉线索进行推理以得出问题答案。在过去几年中,我们见证了视觉问答的显著进展。尽管准确率提升令人印象深刻,但仍难以知晓这些模型是在进行基于视觉线索的推理,还是仅仅利用了训练数据中的虚假相关性。最近,许多工作试图从基础和鲁棒性等角度回答这一问题。然而,它们大多要么聚焦于语言侧,要么粗略地研究像素级注意力图。在本文中,利用 GQA 数据集中提供的逐步对象基础标注,我们首先对视觉推理在基础和鲁棒性方面(特别是视觉侧)进行了系统的以对象为中心的诊断。根据不同模型间的广泛比较,我们发现即使高准确率模型也不擅长精确基础对象,且对视觉内容扰动不鲁棒。相比之下,符号化和模块化模型具有相对更好的基础和鲁棒性,尽管以准确率为代价。为调和这些不同方面,我们进一步开发了一个诊断模型,即图推理机(Graph Reasoning Machine)。我们的模型用概率场景图替代纯符号视觉表示,然后对视觉推理模块应用教师强制(teacher-forcing)训练。所设计的模型在全部三个指标上优于原始神经符号模型,同时继承了透明性。进一步的消融研究表明,这一改进主要源于更准确的图像理解和适当的中间推理监督。
引用
@article{arxiv.2012.11587,
title = {Object-Centric Diagnosis of Visual Reasoning},
author = {Jianwei Yang and Jiayuan Mao and Jiajun Wu and Devi Parikh and David D. Cox and Joshua B. Tenenbaum and Chuang Gan},
journal= {arXiv preprint arXiv:2012.11587},
year = {2020}
}