设计即透明:缩小视觉推理中性能与可解释性之间的差距
计算机视觉与模式识别
2019-01-24 v2
摘要
视觉问答需要对图像进行高阶推理,这是机器系统遵循复杂指令所需的基本能力。近来,模块化网络已被证明是执行视觉推理任务的有效框架。虽然模块化网络最初设计具有一定程度的模型透明性,但其在复杂视觉推理基准上的性能不足。当前最先进的方法未提供理解推理过程的有效机制。在本文中,我们缩小了可解释模型与最先进视觉推理方法之间的性能差距。我们提出一组视觉推理原语,其组合后表现为一个能够以显式可解释方式执行复杂推理任务的模型。这些原语输出的保真度与可解释性带来了诊断所得模型优势与劣势的无与伦比的能力。关键的是,我们表明这些原语具有极高性能,在 CLEVR 数据集上取得了 99.1% 的最先进准确率。我们还表明,当提供少量包含新颖物体属性的数据时,我们的模型能够有效学习泛化表示。利用 CoGenT 泛化任务,我们展示了比当前最先进水平超过 20 个百分点的提升。
引用
@article{arxiv.1803.05268,
title = {Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning},
author = {David Mascharka and Philip Tran and Ryan Soklaski and Arjun Majumdar},
journal= {arXiv preprint arXiv:1803.05268},
year = {2019}
}
备注
CVPR 2018 pre-print