中文

视觉推理:从状态到变换

计算机视觉与模式识别 2023-05-04 v1 人工智能

摘要

大多数现有的视觉推理任务,例如 VQA 中的 CLEVR,忽略了一个重要因素,即变换。它们仅被定义为测试机器在静态设置(如单张图像)内对概念与关系的理解程度。这种\textbf{状态驱动}的视觉推理在反映推断不同状态间动态能力方面存在局限,而皮亚杰理论表明该能力对人类认知同等重要。为应对此问题,我们提出了一种新颖的\textbf{变换驱动}视觉推理(TVR)任务。给定初始与最终状态,目标变为推断相应的中间变换。遵循该定义,首先基于 CLEVR 构建了一个新的合成数据集 TRANCE,包含三种层级设置:基础(单步变换)、事件(多步变换)与视角(多步变换含变视角)。接下来,我们基于 COIN 构建了另一个真实数据集 TRANCO,以弥补 TRANCE 在变换多样性上的缺失。受人类推理启发,我们提出了一种称为 TranNet 的三阶段推理框架,包括观察、分析与结论,以测试近期先进技术在 TVR 上的表现。实验结果表明,最先进的视觉推理模型在基础设置上表现良好,但在事件、视角与 TRANCO 上仍远未达到人类水平的智能。我们相信所提出的新范式将推动机器视觉推理的发展。该方向需探究更先进的方法与新的问题。TVR 的资源见 \url{https://hongxin2019.github.io/TVR/}。

关键词

引用

@article{arxiv.2305.01668,
  title  = {Visual Reasoning: from State to Transformation},
  author = {Xin Hong and Yanyan Lan and Liang Pang and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2305.01668},
  year   = {2023}
}

备注

Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:2011.13160