中文

SVTR:基于单一视觉模型的场景文本识别

计算机视觉与模式识别 2022-05-24 v2

摘要

主流场景文本识别模型通常包含两个模块:用于特征提取的视觉模型与用于文本转录的序列模型。这种混合架构虽准确但复杂且效率较低。本研究提出一种在分块图像分词框架下用于场景文本识别的单一视觉模型(Single Visual model for Scene Text Recognition, SVTR),彻底摒弃了序列建模。该方法称为SVTR,首先将图像文本分解为称为字符成分的小块,随后通过成分级混合、合并和/或组合递归执行分层阶段。设计了全局与局部混合块以感知字符间与字符内模式,实现多粒度字符成分感知,从而通过简单线性预测识别字符。中英文场景文本识别任务的实验结果证明了SVTR的有效性。SVTR-L(Large)在英语上取得极具竞争力的精度,并在中文上大幅优于现有方法,同时推理更快。此外,SVTR-T(Tiny)是一种高效且小得多的模型,在推理时展现出吸引人的速度。代码已公开于https://github.com/PaddlePaddle/PaddleOCR。

关键词

引用

@article{arxiv.2205.00159,
  title  = {SVTR: Scene Text Recognition with a Single Visual Model},
  author = {Yongkun Du and Zhineng Chen and Caiyan Jia and Xiaoting Yin and Tianlun Zheng and Chenxia Li and Yuning Du and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2205.00159},
  year   = {2022}
}

备注

Accepted by IJCAI 2022