中文

用于场景文本识别的上下文感知并行解码器

计算机视觉与模式识别 2023-10-10 v2

摘要

场景文本识别(STR)方法一直难以同时获得高准确率与快速推理速度。基于自回归(AR)的模型以逐字符方式实现识别,准确率占优但推理速度慢。与之相对,基于并行解码(PD)的模型在单次解码过程中推断所有字符,推理更快但准确率通常更差。我们首先对 STR 中的 AR 解码进行实证研究,发现 AR 解码器不仅建模语言上下文,还为视觉上下文感知提供引导。据此,我们提出上下文感知并行解码器(CPPD)以在 PD 过程中预测字符序列。CPPD 设计字符计数模块以推断各字符出现次数,以及字符排序模块以推导无内容阅读顺序与占位符。同时,字符预测任务将占位符与字符相关联。它们共同构建全面的识别上下文。我们构建了一系列 CPPD 模型,并将所提模块插入现有 STR 解码器。在英文与中文基准上的实验表明,CPPD 模型取得了极具竞争力的准确率,同时运行速度约为其基于 AR 的对应模型的 8 倍。此外,插入模块后的模型实现了显著的准确率提升。代码见 \href{https://github.com/PaddlePaddle/PaddleOCR/blob/dygraph/doc/doc_en/algorithm_rec_cppd_en.md}{this https URL}。

关键词

引用

@article{arxiv.2307.12270,
  title  = {Context Perception Parallel Decoder for Scene Text Recognition},
  author = {Yongkun Du and Zhineng Chen and Caiyan Jia and Xiaoting Yin and Chenxia Li and Yuning Du and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2307.12270},
  year   = {2023}
}