中文

用于文本定位的文本视觉语义数据集

计算机视觉与模式识别 2020-04-23 v1 计算与语言

摘要

自然场景中的文本定位包括检测和识别图像中出现的文本(例如招牌、交通信号或服装或物体上的品牌)。由于文本出现语境的复杂性(不平背景、阴影、遮挡、透视畸变等),这是一个具有挑战性的问题。仅有少数方法试图利用文本与其周围环境之间的关系来更好地识别场景中的文本。在本文中,我们提出了一个用于自然场景文本定位的视觉上下文数据集,其中公开可用的数据集COCO-text [Veit et al. 2016]已通过关于场景的信息(如图像中出现的物体和场所)进行了扩展,以使研究者能够在他们的文本定位系统中纳入文本与场景之间的语义关系,并为这类方法提供一个通用框架。对于图像中的每段文本,我们提取三类上下文信息:场景中的物体、图像位置标签以及文本图像描述(caption)。我们使用最先进的现成可用工具来提取这些附加信息。由于该信息为文本形式,它可用于将文本相似度或语义关系方法引入文本定位系统,无论是作为后处理还是端到端训练策略。我们的数据公开于 https://git.io/JeZTb。

关键词

引用

@article{arxiv.2004.10349,
  title  = {Textual Visual Semantic Dataset for Text Spotting},
  author = {Ahmed Sabir and Francesc Moreno-Noguer and Lluís Padró},
  journal= {arXiv preprint arXiv:2004.10349},
  year   = {2020}
}