中文

基于子字符串匹配的超长文本识别

计算机视觉与模式识别 2025-01-23 v3

摘要

场景文本识别(STR)方法在词级文本识别方面表现出色。然而,在实际应用中,文本图像有时因检测到多个水平单词而变得很长,这就需要从现有的短文本数据集构建长文本识别模型,这一问题以前鲜有研究。本文将此任务称为超出长度(Out of Length, OOL)文本识别。我们建立了第一个长文本基准(Long Text Benchmark, LTB),以便评估不同方法在长文本识别中的表现。同时,我们提出了一种新方法,称为基于子字符串匹配的超长文本识别(OOL Text Recognition with sub-String Matching, SMTR)。SMTR由两个基于交叉注意力的模块组成:一个模块将包含多个字符的子字符串编码为下一个和上一个查询,另一个模块利用这些查询注意力图像特征,匹配子字符串并同时识别其下一个和上一个字符。SMTR可以通过迭代上述过程来识别任意长度的文本。为避免陷入对高度相似子字符串的识别,我们引入一种正则化训练,迫使SMTR有效地发现相似子字符串之间的细微差异以实现精确匹配。此外,我们提出了一种推理增强策略,以缓解同一文本中相同子字符串导致的混淆,并提高整体识别效率。大量实验结果表明,SMTR即使仅在短文本数据集上训练,也能在公开的短文本基准测试中超越现有方法,并在LTB上显著优于现有方法。代码:https://github.com/Topdu/OpenOCR。

关键词

引用

@article{arxiv.2407.12317,
  title  = {Out of Length Text Recognition with Sub-String Matching},
  author = {Yongkun Du and Zhineng Chen and Caiyan Jia and Xieping Gao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2407.12317},
  year   = {2025}
}

备注

Accepted by AAAI2025