中文

基于通用检测的文本行识别

计算机视觉与模式识别 2025-03-10 v2

摘要

我们提出一种通用检测方法用于文本行识别,适用于印刷文本(OCR)或手写文本(HTR),以及拉丁文、中文或密码字符。检测方法此前在 HTR 领域鲁磨原因是由于单独读取字符往往困难,字符级标注也难以获取且成本高昂。我们通过三个主要见解来克服这些挑战:(i) 使用足够多样化的合成数据进行预训练,可为任何脚本学习合理的字符定位;(ii) 现代基于变换器的检测器可以联合检测大量实例,如果采用恰当的掩码策略,可利用不同检测之间的一致性;(iii) 一旦获得带有近似字符定位的预训练检测模型,就可以在真实数据上进行基于行级标注的微调,即使不同字母表也可行。我们提出的方法称为 DTLR,与当前 HTR 方法采用完全不同的范式,后者依赖自回归解码,逐个预测字符值,而我们是并行处理整行文本。令人惊讶的是,我们在广泛的脚本范围内表现良好,通常需要专门方法才能处理。在 particular,我们在 CASIA v2 数据集上改进了中文脚本识别的 SOTA 性能,在 Borg 和 Copiale 数据集上改进了密码识别的 SOTA 性能。我们的代码和模型可在 https://github.com/raphael-baena/DTLR 查阅。

关键词

引用

@article{arxiv.2409.17095,
  title  = {General Detection-based Text Line Recognition},
  author = {Raphael Baena and Syrine Kalleli and Mathieu Aubry},
  journal= {arXiv preprint arXiv:2409.17095},
  year   = {2025}
}