中文

学习丰富的图像区域表示以用于视觉问答

计算机视觉与模式识别 2019-10-30 v1

摘要

我们提出通过利用更强大的特征提取器来提升VQA,具体通过改善视觉与文本特征的表示能力以及模型集成来实现。对于视觉特征,使用一些检测技术来改进检测器。对于文本特征,我们采用BERT作为语言模型,并发现其能显著提升VQA性能。我们的方案在VQA Challenge 2019中获得第二名。

关键词

引用

@article{arxiv.1910.13077,
  title  = {Learning Rich Image Region Representation for Visual Question Answering},
  author = {Bei Liu and Zhicheng Huang and Zhaoyang Zeng and Zheyu Chen and Jianlong Fu},
  journal= {arXiv preprint arXiv:1910.13077},
  year   = {2019}
}

备注

Rank 2 in VQA Challenge 2019