中文

一种全面的书写段落文本识别系统:LexiconNet

计算机视觉与模式识别 2023-07-06 v3

摘要

在本研究中,我们提出了一种高效流程,使用了手写文本识别文献中的两种最先进方法,即垂直注意力网络(Vertical Attention Network)与词束搜索(Word Beam Search)。注意力模块负责内部行分割,从而以逐行方式处理页面。在解码步骤中,我们加入了基于连接主义时序分类的词束搜索解码器作为后处理步骤。本研究提出了一种端到端的段落识别系统,并以词典解码器作为后处理步骤。我们的流程在标准数据集上报告了最先进的结果。报告的字符错误率在 IAM 数据集上为 3.24%(提升 27.19%),在 RIMES 上为 1.13%(提升 40.83%),在 READ-16 数据集上为 2.43%(较现有文献提升 32.31%);词错误率在 IAM 数据集上为 8.29%(提升 43.02%),在 RIMES 数据集上为 2.94%(提升 56.25%),在 READ-2016 数据集上为 7.35%(较现有结果提升 47.27%)。本工作报告的字符错误率和词错误率均超越了文献中报道的结果。

关键词

引用

@article{arxiv.2205.11018,
  title  = {A Comprehensive Handwritten Paragraph Text Recognition System: LexiconNet},
  author = {Lalita Kumari and Sukhdeep Singh and Vaibhav Varish Singh Rathore and Anuj Sharma},
  journal= {arXiv preprint arXiv:2205.11018},
  year   = {2023}
}