中文

COCO-Text:自然图像中文本检测与识别的数据集与基准

计算机视觉与模式识别 2016-06-21 v2

摘要

本文描述了COCO-Text数据集。近年来,像SUN和Imagenet这样的大规模数据集推动了场景理解和目标识别的发展。COCO-Text的目标是推进自然图像中文本检测与识别的最先进水平。该数据集基于MS COCO数据集,其包含复杂日常场景的图像。这些图像在收集时并未考虑文本,因此包含广泛的文本实例。为了反映自然场景中文本的多样性,我们标注文本具有:(a)边界框位置,(b)细粒度分类为机器打印文本和手写文本,(c)分类为清晰可读与不可读文本,(d)文本文字体系(script),(e)清晰可读文本的转录。数据集在超过63k图像中包含超过173k文本标注。我们提供标注准确性的统计分析。此外,我们展示了三种领先的先进照片光学字符识别(OCR)方法在我们数据集上的分析。尽管场景文本检测与识别近年来取得强劲进展,我们确定了显著缺陷,以激励未来工作。

关键词

引用

@article{arxiv.1601.07140,
  title  = {COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images},
  author = {Andreas Veit and Tomas Matera and Lukas Neumann and Jiri Matas and Serge Belongie},
  journal= {arXiv preprint arXiv:1601.07140},
  year   = {2016}
}