SVTRv2:CTC在场景文本识别中超越编码器-解码器模型
计算机视觉与模式识别
2025-07-16 v2
摘要
基于连接时序分类(CTC)的场景文本识别(STR)方法(如SVTR)在OCR应用中广泛采用,主要due to其简单的体系结构,该体系结构仅包含视觉模型和CTC对齐的线性分类器,因此具有快速推理能力。然而,它们通常由于难以处理文本不规则性和语言缺失,表现得比编码器-解码器方法(EDTR)效果更差。为解决这些挑战,我们提出了SVTRv2,一种具备处理文本不规则性和建模语言语境能力的CTC模型。首先,提出了多尺度调整策略,将文本实例调整到适当的预定义尺寸,从而有效避免严重的文本扭曲。同时,我们引入特征重排模块,以确保视觉特征满足CTC的要求,从而缓解对齐困境。其次,我们提出了语义指导模块。它将语言语境整合到视觉特征中,使CTC模型能够利用语言信息提高准确度。该模块可以在推理阶段省略,不会增加推理时间成本。我们在标准和最新具有挑战性的基准测试中广泛评估了SVTRv2,在多个情景下与流行的STR模型进行公正比较,包括不同类型的文本不规则性、语言、长文本以及是否使用预训练。SVTRv2在准确度和推理速度方面均超过大多数EDTR。代码:https://github.com/Topdu/OpenOCR。
引用
@article{arxiv.2411.15858,
title = {SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition},
author = {Yongkun Du and Zhineng Chen and Hongtao Xie and Caiyan Jia and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2411.15858},
year = {2025}
}
备注
Accepted by ICCV 2025