回答所有问题!迈向通用视觉问答模型
计算机视觉与模式识别
2019-04-08 v2
摘要
视觉问答(VQA)研究分为两个阵营:第一个侧重于需要自然图像理解的VQA数据集,第二个侧重于测试推理的合成数据集。一个好的VQA算法应该能够同时处理两者,但只有少数VQA算法以这种方式进行测试。我们比较了五种最先进的VQA算法,涵盖了两个领域的八个VQA数据集。为了使比较公平,所有模型都尽可能标准化,例如,它们使用相同的视觉特征、答案词汇表等。我们发现方法不能跨两个领域泛化。为了解决这个问题,我们提出了一种新的VQA算法,在两个领域中都达到或超过了最先进水平。
引用
@article{arxiv.1903.00366,
title = {Answer Them All! Toward Universal Visual Question Answering Models},
author = {Robik Shrestha and Kushal Kafle and Christopher Kanan},
journal= {arXiv preprint arXiv:1903.00366},
year = {2019}
}
备注
8 pages