中文

面向视觉问答系统泛化的 Transformer 模块网络

计算机视觉与模式识别 2023-03-20 v2 机器学习

摘要

Transformer 在视觉问答 (VQA) 上取得了优异的性能。然而,其系统泛化能力,即处理已知概念的新组合的能力,尚不清楚。我们揭示了神经模块网络 (NMNs),即针对子任务的组合式问题特定模块,相比传统 Transformer 取得了更好或相似的系统泛化性能,尽管 NMNs 的模块是基于 CNN 的。为解决 Transformer 相对于 NMNs 的这一不足,本文研究了模块化是否以及如何为 Transformer 带来益处。具体而言,我们提出了 Transformer 模块网络 (TMN),一种基于 Transformer 模块组合的新型 NMN。TMN 在三个 VQA 数据集上取得了最先进的系统泛化性能,对于子任务的新组合比标准 Transformer 提升超过 30%。我们表明,不仅是模块组合,而且每个子任务的模块专门化都是此种性能提升的关键。

关键词

引用

@article{arxiv.2201.11316,
  title  = {Transformer Module Networks for Systematic Generalization in Visual Question Answering},
  author = {Moyuru Yamada and Vanessa D'Amario and Kentaro Takemoto and Xavier Boix and Tomotake Sasaki},
  journal= {arXiv preprint arXiv:2201.11316},
  year   = {2023}
}