中文

用于场景文本识别的集成专家纯Transformer模型

计算机视觉与模式识别 2022-11-10 v1

摘要

场景文本识别(STR)涉及在自然场景裁剪图像中读取文本的任务。STR中的传统模型在编码器-解码器框架中采用卷积神经网络(CNN)后接循环神经网络。近来,transformer架构正被广泛用于STR,因其展现出捕获长程依赖的强能力,而这在场景文本图像中显得突出。许多研究者将transformer用作混合CNN-transformer编码器的一部分,通常后接一个transformer解码器。然而,此类方法仅在编码过程中途利用长程依赖。尽管视觉transformer(ViT)能够在早期阶段捕获此类依赖,但其在STR中的利用仍大体未被充分发掘。本工作提出使用仅含transformer的模型作为简单基线,其性能优于混合CNN-transformer模型。此外,确定了两个关键改进方向。首先,首个解码字符的预测精度最低。其次,不同原始长宽比的图像对块分辨率反应不同,而ViT仅采用一种固定块分辨率。为探索这些方向,提出集成专家纯Transformer(PTIE)。PTIE是一种可处理多种块分辨率并以原始与逆字符顺序解码的transformer模型。其在7个常用基准上接受检验,并与超过20种最先进方法比较。实验结果表明所提方法优于它们,并在大多数基准上取得最先进结果。

关键词

引用

@article{arxiv.2211.04963,
  title  = {Pure Transformer with Integrated Experts for Scene Text Recognition},
  author = {Yew Lee Tan and Adams Wai-kin Kong and Jung-Jae Kim},
  journal= {arXiv preprint arXiv:2211.04963},
  year   = {2022}
}

备注

Accepted in ECCV2022