场景文本视觉问答
计算机视觉与模式识别
2019-10-17 v2
摘要
当前的视觉问答数据集未考虑图像中文本所传达的丰富语义信息。在这项工作中,我们提出了一个新数据集 ST-VQA,旨在强调在 VQA 过程中利用图像中作为文本线索存在的高层语义信息的重要性。我们利用该数据集定义了一系列难度递增的任务,对于这些任务,在视觉信息所提供的上下文中阅读场景文本是推理并生成恰当答案所必需的。我们为这些任务提出了一种新的评估指标,以同时考虑推理错误以及文本识别模块的缺陷。此外,我们提出了一系列基线方法,这些方法为进一步了解新发布的数据集提供了见解,并为后续研究奠定了基础。
引用
@article{arxiv.1905.13648,
title = {Scene Text Visual Question Answering},
author = {Ali Furkan Biten and Ruben Tito and Andres Mafla and Lluis Gomez and Marçal Rusiñol and Ernest Valveny and C. V. Jawahar and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:1905.13648},
year = {2019}
}
备注
International Conference on Computer Vision (ICCV 2019)