中文

SVIPTR:基于视觉可置换提取器的快速高效场景文本识别

计算机视觉与模式识别 2024-08-21 v5

摘要

场景文本识别(Scene Text Recognition, STR)是构建结构化信息数据库的一项重要且具挑战性的上游任务,涉及识别自然场景图像中的文本。尽管当前用于 STR 的 SOTA 模型表现出高性能,但由于依赖由视觉编码器和序列解码器组成的混合架构,它们通常存在推理效率低的问题。在本工作中,我们提出了一种用于快速高效场景文本识别的视觉可置换提取器(SVIPTR),它在 STR 领域实现了高性能与快速推理速度之间的出色平衡。具体而言,SVIPTR 采用具有金字塔结构的视觉-语义提取器,其特征在于局部和全局自注意力层的置换与组合。这种设计产生了一个轻量且高效的模型,且其推理对输入长度不敏感。在用于中文和英文场景文本识别的各种标准数据集上的大量实验结果验证了 SVIPTR 的优越性。值得注意的是,SVIPTR-T(Tiny)变体提供了与其他轻量级模型相当的高竞争力准确率,并实现了 SOTA 推理速度。同时,SVIPTR-L(Large)在单编码器类型模型中达到了 SOTA 准确率,同时保持了低参数量和良好的推理速度。我们提出的方法为 STR 挑战提供了引人注目的解决方案,这极大地有益于需要快速高效 STR 的实际应用。代码公开于 https://github.com/cxfyxl/VIPTR。

关键词

引用

@article{arxiv.2401.10110,
  title  = {SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor},
  author = {Xianfu Cheng and Weixiao Zhou and Xiang Li and Jian Yang and Hang Zhang and Tao Sun and Wei Zhang and Yuying Mai and Tongliang Li and Xiaoming Chen and Zhoujun Li},
  journal= {arXiv preprint arXiv:2401.10110},
  year   = {2024}
}

备注

10 pages, 4 figures, 6 tables