中文

为网格特征在视觉问答中的有效性辩护

计算机视觉与模式识别 2020-04-06 v2

摘要

作为“自底向上”注意力而流行的基于边界框(或区域)的视觉特征,最近已超越原始的基于网格的卷积特征,成为视觉问答(VQA)等视觉与语言任务的既定标准。然而,尚不清楚区域的优势(例如更好的定位)是否是自底向上注意力成功的关键原因。在本文中,我们重新审视用于VQA的网格特征,发现它们可以出奇地好——在具有相同精度的情况下运行速度快一个数量级以上(例如,若以类似方式预训练)。通过大量实验,我们验证了该观察结果在不同的VQA模型(在VQA 2.0 test-std上报告了最先进的精度72.71)、数据集中成立,并很好地推广到其他任务如图像描述。由于网格特征使模型设计和训练过程大为简化,这使我们能够端到端地训练它们,并使用更灵活的网络设计。我们端到端地学习VQA模型,从像素直接到答案,并表明在不使用任何区域标注进行预训练的情况下也能实现强劲性能。我们希望我们的发现有助于进一步改进VQA的科学理解和实际应用。代码与特征将公开提供。

关键词

引用

@article{arxiv.2001.03615,
  title  = {In Defense of Grid Features for Visual Question Answering},
  author = {Huaizu Jiang and Ishan Misra and Marcus Rohrbach and Erik Learned-Miller and Xinlei Chen},
  journal= {arXiv preprint arXiv:2001.03615},
  year   = {2020}
}