日常场景中文本块图像数据集
计算机视觉与模式识别
2016-10-21 v1
摘要
本文描述了一个包含日常场景中小型文本图像的数据集。该数据集旨在支持能够检测和分析文本的新型自动化系统的开发。尽管已有大量研究致力于扫描文档中的文本检测与识别,但对其他类型图像(例如社交媒体网站上发布的照片)中的文本检测关注相对较少。这个名为COCO-Text-Patch的新数据集包含约354,000张小型图像,每张都被标记为“文本”或“非文本”。该数据集特别针对文本验证问题,这是端到端文本检测与识别流程中的一个关键阶段。为了评估该数据集的实用性,它已被用于训练两个深度卷积神经网络来区分文本与非文本。一个网络受GoogLeNet架构启发,第二个网络基于CaffeNet。使用这两个网络分别获得了90.2%和90.9%的准确率。本文描述的所有图像、源代码和深度学习训练模型将公开发布。
引用
@article{arxiv.1610.06494,
title = {An Image Dataset of Text Patches in Everyday Scenes},
author = {Ahmed Ibrahim and A. Lynn Abbott and Mohamed E. Hussein},
journal= {arXiv preprint arXiv:1610.06494},
year = {2016}
}
备注
Accepted in the 12th International Symposium on Visual Computing (ISVC'16)