中文

日常场景中文本块图像数据集

计算机视觉与模式识别 2016-10-21 v1

摘要

本文描述了一个包含日常场景中小型文本图像的数据集。该数据集旨在支持能够检测和分析文本的新型自动化系统的开发。尽管已有大量研究致力于扫描文档中的文本检测与识别,但对其他类型图像(例如社交媒体网站上发布的照片)中的文本检测关注相对较少。这个名为COCO-Text-Patch的新数据集包含约354,000张小型图像,每张都被标记为“文本”或“非文本”。该数据集特别针对文本验证问题,这是端到端文本检测与识别流程中的一个关键阶段。为了评估该数据集的实用性,它已被用于训练两个深度卷积神经网络来区分文本与非文本。一个网络受GoogLeNet架构启发,第二个网络基于CaffeNet。使用这两个网络分别获得了90.2%和90.9%的准确率。本文描述的所有图像、源代码和深度学习训练模型将公开发布。

关键词

引用

@article{arxiv.1610.06494,
  title  = {An Image Dataset of Text Patches in Everyday Scenes},
  author = {Ahmed Ibrahim and A. Lynn Abbott and Mohamed E. Hussein},
  journal= {arXiv preprint arXiv:1610.06494},
  year   = {2016}
}

备注

Accepted in the 12th International Symposium on Visual Computing (ISVC'16)