中文

用于求解视觉推理问题的循环视觉 Transformer

计算机视觉与模式识别 2021-11-30 v1

摘要

尽管卷积神经网络(CNNs)在许多视觉任务中取得了显著成果,它们仍受困于简单却具挑战性的视觉推理问题。受近期 Transformer 网络在计算机视觉中成功的启发,本文引入循环视觉 Transformer(RViT)模型。得益于循环连接和空间注意力在推理任务中的影响,该网络在 SVRT 数据集的同异视觉推理问题上取得了有竞争力的结果。在空间与深度维度上的权值共享对模型起到正则化作用,使其能用远更少的自由参数学习,仅使用 28k 训练样本。全面的消融实验证实了混合 CNN + Transformer 架构的重要性以及反馈连接的作用,后者迭代地精炼内部表征直至获得稳定预测。最后,本研究可为深入理解注意力和循环连接在求解视觉抽象推理任务中的作用奠定基础。

关键词

引用

@article{arxiv.2111.14576,
  title  = {Recurrent Vision Transformer for Solving Visual Reasoning Problems},
  author = {Nicola Messina and Giuseppe Amato and Fabio Carrara and Claudio Gennaro and Fabrizio Falchi},
  journal= {arXiv preprint arXiv:2111.14576},
  year   = {2021}
}