TextCaps:一个用于具备阅读理解能力的图像描述的数据集
计算机视觉与模式识别
2020-08-05 v2 计算与语言
摘要
图像描述可以帮助视障人士快速理解图像内容。尽管我们在图像自动描述和光学字符识别方面取得了显著进展,当前方法仍无法在描述中纳入书写文本,尽管文本在人类环境中无处不在且常对理解周边至关重要。为研究如何在图像语境下理解文本,我们收集了一个新颖的数据集TextCaps,包含28k张图像的145k条描述。我们的数据集要求模型识别文本、将其与视觉语境关联,并决定复制或改写文本的哪些部分,需要在多个文本标记与视觉实体(如物体)之间进行空间、语义与视觉推理。我们研究了基线方法并将现有方法适配到这一我们称之为具备阅读理解能力的图像描述的新任务上。通过自动与人工研究的分析表明,相较于先前的数据集,我们的新TextCaps数据集带来了许多新的技术挑战。
引用
@article{arxiv.2003.12462,
title = {TextCaps: a Dataset for Image Captioning with Reading Comprehension},
author = {Oleksii Sidorov and Ronghang Hu and Marcus Rohrbach and Amanpreet Singh},
journal= {arXiv preprint arXiv:2003.12462},
year = {2020}
}
备注
To appear in ECCV 2020 (oral) Project page: https://textvqa.org/textcaps