中文

基于语义的图像文本识别深度神经网络

计算机视觉与模式识别 2019-12-11 v3

摘要

最先进的文本定位系统通常旨在检测自然场景图像中孤立的单词或逐词文本,而忽略文本区域内的语义连贯性。然而,当一起解读时,看似孤立的单词可能更容易识别。在此基础上,我们提出了一种新颖的“基于语义的文本识别”(STR)深度学习模型,该模型借助理解上下文来读取图像中的文本。STR由多个模块组成。我们引入了文本分组与排列(TGA)算法来连接并排序孤立的文本区域。一个文本识别网络解释孤立的单词。受益于语义信息,一个序列到序列网络模型高效地纠正STR流程早期产生的不准确和不确定的短语。我们在两个新的不同数据集上进行了实验,分别包含室内设计的扫描目录图像和带有手写标语的抗议者照片。我们的结果表明,我们的STR模型在两个数据集上都优于使用最先进单字识别技术的基线方法。STR在目录图像上达到了90%的高准确率,在更困难的抗议图像上达到71%,表明其在文本识别方面的通用性。

关键词

引用

@article{arxiv.1908.01403,
  title  = {Deep Neural Network for Semantic-based Text Recognition in Images},
  author = {Yi Zheng and Qitong Wang and Margrit Betke},
  journal= {arXiv preprint arXiv:1908.01403},
  year   = {2019}
}