中文

回答所有问题!迈向通用视觉问答模型

计算机视觉与模式识别 2019-04-08 v2

摘要

视觉问答(VQA)研究分为两个阵营:第一个侧重于需要自然图像理解的VQA数据集,第二个侧重于测试推理的合成数据集。一个好的VQA算法应该能够同时处理两者,但只有少数VQA算法以这种方式进行测试。我们比较了五种最先进的VQA算法,涵盖了两个领域的八个VQA数据集。为了使比较公平,所有模型都尽可能标准化,例如,它们使用相同的视觉特征、答案词汇表等。我们发现方法不能跨两个领域泛化。为了解决这个问题,我们提出了一种新的VQA算法,在两个领域中都达到或超过了最先进水平。

关键词

引用

@article{arxiv.1903.00366,
  title  = {Answer Them All! Toward Universal Visual Question Answering Models},
  author = {Robik Shrestha and Kushal Kafle and Christopher Kanan},
  journal= {arXiv preprint arXiv:1903.00366},
  year   = {2019}
}

备注

8 pages