ICDAR 2019 场景文本视觉问答竞赛
计算机视觉与模式识别
2019-07-02 v1
摘要
本文呈现 ICDAR 2019 场景文本视觉问答竞赛(ST-VQA)的最终结果。ST-VQA 引入了一个迄今任何视觉问答系统均未解决的重要方面,即融入场景文本以回答关于图像的问题。该竞赛引入了一个新数据集,包含 23,038 张图像,标注有 31,791 个问答对,其中答案始终基于图像中出现的文本实例。图像取自 7 个不同的公开计算机视觉数据集,涵盖广泛场景。竞赛结构为三个难度递增的任务,要求阅读场景中的文本并在场景上下文中理解它,以正确回答给定问题。提出了一种新颖的评估指标,优雅地评估最优模型应具备的两项关键能力:文本识别与图像理解。展示了来自不同参与者的详细结果分析,从而洞察能够阅读的 VQA 系统的当前能力。我们坚信本次挑战提出的数据集将是迈向更鲁棒和通用、可利用场景文本实现整体图像理解的模型之路上一个重要里程碑。
引用
@article{arxiv.1907.00490,
title = {ICDAR 2019 Competition on Scene Text Visual Question Answering},
author = {Ali Furkan Biten and Rubèn Tito and Andres Mafla and Lluis Gomez and Marçal Rusiñol and Minesh Mathew and C. V. Jawahar and Ernest Valveny and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:1907.00490},
year = {2019}
}
备注
15th International Conference on Document Analysis and Recognition (ICDAR 2019)