中文

SAViR-T:基于 Transformer 的空间注意力视觉推理

计算机视觉与模式识别 2022-06-23 v2

摘要

我们提出了一种新颖的计算模型“SAViR-T”,用于解决 Raven 渐进矩阵(RPM)所体现的一类视觉推理问题。该模型考虑了谜题中每张图像内视觉元素的显式空间语义,并将其编码为空间-视觉令牌,同时学习与视觉推理任务高度相关的图像内及图像间令牌依赖关系。通过基于 Transformer 的 SAViR-T 架构建模的令牌级关系,利用组规则一致性提取组(行或列)驱动的表示,并以此作为归纳偏置,在 RPM 的前两行(或列)中按令牌提取底层规则表示。我们利用这些关系表示来定位完成 RPM 最后一行或列的正确答案图像。在包括 RAVEN、I-RAVEN、RAVEN-FAIR 和 PGM 在内的合成 RPM 基准测试,以及基于自然图像的“V-PROM”上的大量实验表明,SAViR-T 为视觉推理设立了新的最先进水平,以显著优势超越了先前模型的性能。

关键词

引用

@article{arxiv.2206.09265,
  title  = {SAViR-T: Spatially Attentive Visual Reasoning with Transformers},
  author = {Pritish Sahu and Kalliopi Basioti and Vladimir Pavlovic},
  journal= {arXiv preprint arXiv:2206.09265},
  year   = {2022}
}