中文

自然场景中的中文文本

计算机视觉与模式识别 2018-03-02 v1

摘要

我们介绍了 Chinese Text in the Wild,一个包含街景图像中中文文本的极大型数据集。尽管文档图像中的光学字符识别(OCR)已有充分研究且有许多商用工具可用,自然图像中文本的检测与识别仍是一个具有挑战性的问题,尤其是对于像中文这样更为复杂的字符集。训练数据的缺乏一直是一个问题,特别是对于需要海量训练数据的深度学习方法。在本文中,我们提供了一个新创建的中文文本数据集的详细信息,该数据集包含约 1 百万个由专家标注的中文字符,分布于三万余张街景图像中。这是一个具有良好多样性且具挑战性的数据集。它包含平面文本、凸起文本、城市文本、乡村文本、光照不足文本、远处文本、部分遮挡文本等。对于数据集中的每个字符,标注包括其底层字符、边界框以及 6 个属性。这些属性指示其是否具有复杂背景、是否凸起、是手写还是印刷等。该数据集的大规模和多样性使其适用于训练鲁棒的神经网络以完成各种任务,特别是检测与识别。我们使用若干最先进的网络给出基线结果,包括用于字符识别的 AlexNet、OverFeat、Google Inception 和 ResNet,以及用于图像中字符检测的 YOLOv2。总体而言,Google Inception 在识别上表现最佳,top-1 准确率为 80.5%,而 YOLOv2 在检测上达到 71.0% 的 mAP。数据集、源代码和训练好的模型均将在网站上公开提供。

关键词

引用

@article{arxiv.1803.00085,
  title  = {Chinese Text in the Wild},
  author = {Tai-Ling Yuan and Zhe Zhu and Kun Xu and Cheng-Jun Li and Shi-Min Hu},
  journal= {arXiv preprint arXiv:1803.00085},
  year   = {2018}
}