更快的 DAN:基于文档位置编码与多目标查询的端到端手写文档识别
计算机视觉与模式识别
2023-08-31 v1
摘要
手写文本识别的最新进展使得以端到端方式识别整个文档成为可能:文档注意力网络(DAN)通过基于注意力的预测过程逐个识别字符,直到文档结束。然而,这种自回归过程导致推理无法受益于任何并行化优化。在本文中,我们提出 Faster DAN,一种在预测时加速识别过程的两步策略:模型预测文档中每个文本行的第一个字符,然后通过多目标查询和特定的文档位置编码方案并行补全所有文本行。Faster DAN 相比标准 DAN 取得了具有竞争力的结果,同时在 RIMES 2009、READ 2016 和 MAURDOR 数据集的整页单页和双页图像上至少快 4 倍。源代码和训练好的模型权重可在 https://github.com/FactoDeepLearning/FasterDAN 获取。
引用
@article{arxiv.2301.10593,
title = {Faster DAN: Multi-target Queries with Document Positional Encoding for End-to-end Handwritten Document Recognition},
author = {Denis Coquenet and Clément Chatelain and Thierry Paquet},
journal= {arXiv preprint arXiv:2301.10593},
year = {2023}
}