变换驱动的视觉推理
计算机视觉与模式识别
2021-04-05 v2 人工智能
机器学习
摘要
本文通过引入一个关键因素即变换,定义了一种新的视觉推理范式。其动机在于,大多数现有视觉推理任务(如 VQA 中的 CLEVR)仅被定义为测试机器在静态设置(如单幅图像)内对概念与关系的理解程度。我们认为,这种\textbf{状态驱动的视觉推理}方法在反映机器是否具备推断不同状态间动态变化的能力方面存在局限,而皮亚杰理论已表明状态间动态推断对于人类认知与状态级推理同等重要。为解决这个问题,我们提出了一种新颖的\textbf{变换驱动的视觉推理}任务。给定初始与最终状态,目标是推断相应的单步或多步变换,分别表示为三元组(对象,属性,值)或三元组序列。依此定义,我们在 CLEVR 基础上构建了一个名为 TRANCE 的新数据集,包含三种层级设置:Basic(单步变换)、Event(多步变换)与 View(带视角变化的多步变换)。实验结果表明,最先进的视觉推理模型在 Basic 上表现良好,但在 Event 与 View 上仍远未达到人类水平的智能。我们相信所提出的新范式将推动机器视觉推理的发展。该方向上需研究更先进的方法与真实数据。TVR 的资源可在 https://hongxin2019.github.io/TVR 获取。
引用
@article{arxiv.2011.13160,
title = {Transformation Driven Visual Reasoning},
author = {Xin Hong and Yanyan Lan and Liang Pang and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2011.13160},
year = {2021}
}
备注
Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR