迈向能够阅读的 VQA 模型
计算与语言
2019-05-15 v2 计算机视觉与模式识别
机器学习
摘要
研究表明,视觉受损用户就其周边图像所提问的主导类别涉及阅读图像中的文本。但如今的 VQA 模型无法阅读!我们的论文朝解决此问题迈出第一步。首先,我们引入一个新的“TextVQA”数据集以推动这一重要问题的进展。现有数据集要么关于文本的问题占比很小(如 VQA 数据集),要么规模太小(如 VizWiz 数据集)。TextVQA 包含针对 28,408 张图像的 45,336 个问题,回答这些问题需要关于文本推理。其次,我们引入一种新颖的模型架构,它阅读图像中的文本,在图像与问题的上下文中对其推理,并预测答案——答案可能是基于文本与图像的推断,或由图像中发现的字符串组成。因此,我们称我们的方法为 Look, Read, Reason & Answer (LoRRA)。我们表明 LoRRA 在我们的 TextVQA 数据集上优于现有的最先进 VQA 模型。我们发现,在 TextVQA 上人类表现与机器表现之间的差距显著大于在 VQA 2.0 上的差距,表明 TextVQA 非常适合沿与 VQA 2.0 互补的方向基准化进展。
引用
@article{arxiv.1904.08920,
title = {Towards VQA Models That Can Read},
author = {Amanpreet Singh and Vivek Natarajan and Meet Shah and Yu Jiang and Xinlei Chen and Dhruv Batra and Devi Parikh and Marcus Rohrbach},
journal= {arXiv preprint arXiv:1904.08920},
year = {2019}
}
备注
CVPR 2019