基于可学习融合的多粒度预测用于场景文本识别
计算机视觉与模式识别
2023-07-26 v1
摘要
由于巨大的技术挑战和广泛的应用范围,场景文本识别(STR)多年来一直是计算机视觉中的活跃研究课题。为解决这一难题,已相继提出众多创新方法,而将语言知识融入STR模型最近成为显著趋势。本工作中,我们首先受视觉Transformer(ViT)近期进展的启发,构建了一个概念简单但功能强大的视觉STR模型,其基于ViT和定制的自适应寻址与聚合(A)模块。它已超越大多数先前最先进的场景文本识别模型,包括纯视觉模型和语言增强方法。为整合语言知识,我们进一步提出一种多粒度预测策略,以隐式方式将语言模态信息注入模型,即除传统的字符级表示外,引入NLP中广泛使用的子词表示(BPE和WordPiece),而不采用独立的语言模型(LM)。为生成最终识别结果,设计了两种有效融合多粒度预测的策略。所得算法(称为MGP-STR)能够将STR的性能边界推向更高水平。具体而言,MGP-STR在标准场景文本识别基准上达到平均94%的识别准确率。此外,它在广泛使用的手写基准及更具挑战性的场景文本数据集上也取得最先进结果,证明了所提MGP-STR算法的通用性。源代码与模型将发布于:\url{https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/MGP-STR}。
引用
@article{arxiv.2307.13244,
title = {Multi-Granularity Prediction with Learnable Fusion for Scene Text Recognition},
author = {Cheng Da and Peng Wang and Cong Yao},
journal= {arXiv preprint arXiv:2307.13244},
year = {2023}
}
备注
submitted to TPAMI; an extension to our previous ECCV 2022 paper arXiv:2209.03592