中文

重新思考文本行识别模型

计算机视觉与模式识别 2021-04-23 v2 机器学习

摘要

本文中,我们研究文本行识别问题。与大多数针对特定领域(如场景文本或手写文档)的方法不同,我们探讨开发一个通用架构的普遍问题,该架构可从任意图像中提取文本,而不论其来源或输入模态。我们考虑两类解码器族(连接时序分类与Transformer)与三种编码器模块(双向LSTMs、自注意力与GRCLs),并开展大量实验以比较它们在广泛使用的场景与手写文本公开数据集上的准确率与性能。我们发现,文献中迄今很少受到关注的一种组合,即自注意力编码器与CTC解码器相耦合,在与外部语言模型结合并在公开与内部数据上训练时,在准确率与计算复杂度上优于所有其他组合。与更常见的基于Transformer的模型不同,该架构可处理任意长度的输入,这是通用行识别的一项要求。利用从多来源收集的内部数据集,我们还揭示了当前公开数据集在评估行识别器准确率方面的局限性,因为相对狭窄的图像宽度与序列长度分布无法观察到Transformer方法在应用于长行转写时质量下降的现象。

关键词

引用

@article{arxiv.2104.07787,
  title  = {Rethinking Text Line Recognition Models},
  author = {Daniel Hernandez Diaz and Siyang Qin and Reeve Ingle and Yasuhisa Fujii and Alessandro Bissacco},
  journal= {arXiv preprint arXiv:2104.07787},
  year   = {2021}
}

备注

11 pages, 6 figures