中文

基于深度学习的无词典高效 OCR

计算机视觉与模式识别 2019-06-06 v1 机器学习

摘要

与普遍看法相反,当文本出现在非受限环境(如自然场景)中时,由于几何畸变、复杂背景与多样字体,光学字符识别(OCR)仍是一项具有挑战性的问题。在本文中,我们提出一种无分割的 OCR 系统,其结合了深度学习方法、合成训练数据生成与数据增强技术。我们使用大型文本语料库与超过 2000 种字体渲染合成训练数据。为模拟复杂自然场景中的文本,我们用几何畸变与一种所提出的数据增强技术——与背景纹理的 alpha 合成(alpha-compositing)来增强提取的样本。我们的模型采用卷积神经网络编码器从文本图像中提取特征。受神经机器翻译与语言建模近期进展的启发,我们考察了循环与卷积神经网络在建模输入元素间交互上的能力。

关键词

引用

@article{arxiv.1906.01969,
  title  = {Efficient, Lexicon-Free OCR using Deep Learning},
  author = {Marcin Namysl and Iuliu Konya},
  journal= {arXiv preprint arXiv:1906.01969},
  year   = {2019}
}

备注

Accepted for presentation in the 15th International Conference on Document Analysis and Recognition (ICDAR 2019)