基于深度学习的泰卢固语OCR框架
机器学习
2017-02-16 v2 人工智能
计算机视觉与模式识别
机器学习
神经与进化计算
摘要
在本文中,我们解决了泰卢固文字的光学字符识别(OCR)任务。我们提出了一个端到端框架,该框架分割文本图像、对字符进行分类,并利用语言模型提取文本行。分割基于数学形态学。分类模块是这三项中最具挑战性的任务,它是一个深度卷积神经网络。该语言在字形层面被建模为三阶马尔可夫链。泰卢固文是一种复杂的元音附标文字,且该语言具有黏着性,使得问题困难。在本文中,我们应用神经网络的最新进展实现了最先进的错误率。我们还详细回顾了卷积神经网络,并阐述了使深度学习生效的许多技巧背后的统计学依据。
引用
@article{arxiv.1509.05962,
title = {Telugu OCR Framework using Deep Learning},
author = {Rakesh Achanta and Trevor Hastie},
journal= {arXiv preprint arXiv:1509.05962},
year = {2017}
}