用于场景文本识别的多粒度预测
计算机视觉与模式识别
2022-10-18 v2
摘要
场景文本识别(STR)多年来一直是计算机视觉中的活跃研究课题。为解决这一具有挑战性的问题,人们相继提出了许多创新方法,而将语言知识融入 STR 模型最近成为一种显著趋势。在这项工作中,我们首先从 Vision Transformer(ViT)的近期进展中获得灵感,构建了一个概念简单但强大的视觉 STR 模型,该模型基于 ViT 构建,并且在场景文本识别上优于以往最先进的模型,包括纯视觉模型和语言增强方法。为整合语言知识,我们进一步提出一种多粒度预测(Multi-Granularity Prediction)策略,以隐式方式将来自语言模态的信息注入模型,即除了传统的字符级表示外,将 NLP 中广泛使用的子词表示(BPE 和 WordPiece)引入输出空间,同时不采用独立的语言模型(LM)。所得算法(称为 MGP-STR)能够将 STR 的性能边界推向更高水平。具体而言,它在标准基准上实现了 93.35% 的平均识别准确率。代码可在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/MGP-STR 获取。
引用
@article{arxiv.2209.03592,
title = {Multi-Granularity Prediction for Scene Text Recognition},
author = {Peng Wang and Cheng Da and Cong Yao},
journal= {arXiv preprint arXiv:2209.03592},
year = {2022}
}
备注
Accepted by ECCV2022