中文

用于场景文本识别的多粒度预测

计算机视觉与模式识别 2022-10-18 v2

摘要

场景文本识别(STR)多年来一直是计算机视觉中的活跃研究课题。为解决这一具有挑战性的问题,人们相继提出了许多创新方法,而将语言知识融入 STR 模型最近成为一种显著趋势。在这项工作中,我们首先从 Vision Transformer(ViT)的近期进展中获得灵感,构建了一个概念简单但强大的视觉 STR 模型,该模型基于 ViT 构建,并且在场景文本识别上优于以往最先进的模型,包括纯视觉模型和语言增强方法。为整合语言知识,我们进一步提出一种多粒度预测(Multi-Granularity Prediction)策略,以隐式方式将来自语言模态的信息注入模型,即除了传统的字符级表示外,将 NLP 中广泛使用的子词表示(BPE 和 WordPiece)引入输出空间,同时不采用独立的语言模型(LM)。所得算法(称为 MGP-STR)能够将 STR 的性能边界推向更高水平。具体而言,它在标准基准上实现了 93.35% 的平均识别准确率。代码可在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/MGP-STR 获取。

关键词

引用

@article{arxiv.2209.03592,
  title  = {Multi-Granularity Prediction for Scene Text Recognition},
  author = {Peng Wang and Cheng Da and Cong Yao},
  journal= {arXiv preprint arXiv:2209.03592},
  year   = {2022}
}

备注

Accepted by ECCV2022