中文

DAN:一种用于手写文档识别的无分割文档注意力网络

计算机视觉与模式识别 2023-01-12 v4

摘要

无约束手写文本识别是一项具有挑战性的计算机视觉任务。传统上采用两步法,结合行分割与文本行识别。我们首次提出一种用于手写文档识别任务的端到端无分割架构:文档注意力网络(Document Attention Network)。除文本识别外,该模型还以类 XML 方式使用起止标签对文本部分进行标注训练。模型由用于特征提取的 FCN 编码器与一叠 transformer 解码器层组成,以进行递归的逐 token 预测过程。它接收整页文本文档作为输入,顺序输出字符以及逻辑版面 token。与现有基于分割的方法相反,该模型训练时未使用任何分割标签。我们在 READ 2016 数据集的页级与双页级分别取得具竞争力的结果,CER 分别为 3.43% 与 3.70%。我们还给出了在 RIMES 2009 数据集页级的结果,CER 达 4.54%。我们在 https://github.com/FactoDeepLearning/DAN 提供全部源代码与预训练模型权重。

关键词

引用

@article{arxiv.2203.12273,
  title  = {DAN: a Segmentation-free Document Attention Network for Handwritten Document Recognition},
  author = {Denis Coquenet and Clément Chatelain and Thierry Paquet},
  journal= {arXiv preprint arXiv:2203.12273},
  year   = {2023}
}