中文

SEE:面向半监督端到端场景文本识别

计算机视觉与模式识别 2017-12-18 v1

摘要

在自然场景图像中检测与识别文本是一项具有挑战性且尚未完全解决的任务。近年来,已有若干新系统尝试解决两个子任务(文本检测与文本识别)中的至少一个。本文提出SEE,一种面向场景文本检测与识别的半监督神经网络,可向端到端优化。大多数现有工作由多个深度神经网络和若干预处理步骤组成。与此相反,我们提出使用单一深度神经网络,以半监督方式从自然图像中学习检测和识别文本。SEE是一个集成并联合学习空间变换网络的网络,该网络可学习检测图像中的文本区域,以及一个文本识别网络,其接收已识别的文本区域并识别其文本内容。我们介绍了这一新方法背后的思路,并通过在标准基准数据集上的一系列实验展示了其可行性,取得了具有竞争力的结果。

关键词

引用

@article{arxiv.1712.05404,
  title  = {SEE: Towards Semi-Supervised End-to-End Scene Text Recognition},
  author = {Christian Bartz and Haojin Yang and Christoph Meinel},
  journal= {arXiv preprint arXiv:1712.05404},
  year   = {2017}
}

备注

AAAI-18. arXiv admin note: substantial text overlap with arXiv:1707.08831