中文

利用联合网络集成改进基于块的场景文本文字系统识别

计算机视觉与模式识别 2017-02-02 v2

摘要

本文关注场景文本图像中的文字系统识别问题。使用最先进的CNN分类器面对该问题并非易事,因为它们未能解决场景文本实例的一个关键特性:其极可变的长宽比。不同于典型整体CNN分类器将输入图像缩放至固定长宽比,我们在此提出一种基于块的分类框架,以保留图像中作为其类别特征的判别性部分。我们描述了一种基于联合网络集成使用的新方法,在基于块的分类方案中联合学习判别性笔画部分表示及其相对重要性。我们通过该学习过程的实验展示了在两个公开文字系统识别数据集上的最先进结果。此外,我们提出了一个新的公开基准数据集,用于评估多语言场景文本端到端阅读系统。在该数据集上进行的实验证明了文字系统识别在完整端到端系统中的关键作用,该系统将我们的文字系统识别方法与先前发布的文本检测器和现成的OCR引擎相结合。

关键词

引用

@article{arxiv.1602.07480,
  title  = {Improving patch-based scene text script identification with ensembles of conjoined networks},
  author = {Lluis Gomez and Anguelos Nicolaou and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:1602.07480},
  year   = {2017}
}