理解视觉推理背后的计算需求
计算机视觉与模式识别
2022-03-03 v2 人工智能
摘要
视觉理解需要理解场景内物体之间复杂的视觉关系。在此,我们试图刻画抽象视觉推理的计算需求。我们通过系统评估现代深度卷积神经网络(CNNs)学习解决“合成视觉推理测试”(SVRT)挑战的能力来做到这一点,该挑战是二十三个视觉推理问题的集合。我们的分析揭示了一种新颖的视觉推理任务分类法,它主要可由关系类型(相同-不同与空间关系判断)以及用于组合底层规则的关系数量来解释。先前的认知神经科学工作表明注意力在人类视觉推理能力中起关键作用。为检验这一假设,我们用基于空间和基于特征的注意力机制扩展了 CNNs。在第二系列实验中,我们评估了这些注意力网络学习解决 SVRT 挑战的能力,发现所得架构在解决这些视觉推理任务中最困难的任务时效率高得多。最重要的是,在单个任务上的相应改进部分解释了我们的新颖分类法。总体而言,本工作提供了视觉推理的细粒度计算说明,并产生了关于基于特征与基于空间的注意力因视觉推理问题类型而异的差异化需求的、可检验的神经科学预测。
引用
@article{arxiv.2108.03603,
title = {Understanding the computational demands underlying visual reasoning},
author = {Mohit Vaishnav and Remi Cadene and Andrea Alamia and Drew Linsley and Rufin VanRullen and Thomas Serre},
journal= {arXiv preprint arXiv:2108.03603},
year = {2022}
}
备注
26 pages, 16 figures