学习丰富的图像区域表示以用于视觉问答
计算机视觉与模式识别
2019-10-30 v1
摘要
我们提出通过利用更强大的特征提取器来提升VQA,具体通过改善视觉与文本特征的表示能力以及模型集成来实现。对于视觉特征,使用一些检测技术来改进检测器。对于文本特征,我们采用BERT作为语言模型,并发现其能显著提升VQA性能。我们的方案在VQA Challenge 2019中获得第二名。
引用
@article{arxiv.1910.13077,
title = {Learning Rich Image Region Representation for Visual Question Answering},
author = {Bei Liu and Zhicheng Huang and Zhaoyang Zeng and Zheyu Chen and Jianlong Fu},
journal= {arXiv preprint arXiv:1910.13077},
year = {2019}
}
备注
Rank 2 in VQA Challenge 2019