中文

SwinTextSpotter v2:迈向更优协同的场景文本识别

计算机视觉与模式识别 2025-04-09 v3

摘要

端到端场景文本识别旨在读取自然图像中的文字,近年来备受关注。然而,当前最先进的方法通常仅通过共享主干网络来结合检测与识别,并未直接利用两个任务之间的特征交互。本文提出了一种新的端到端场景文本识别框架 SwinTextSpotter v2,旨在寻找文本检测与识别之间更好的协同作用。具体而言,我们利用新颖的识别转换和识别对齐模块来增强两个任务之间的关系。识别转换通过识别损失显式地引导文本定位,而识别对齐则通过检测预测动态提取用于识别的文本特征。这种简单而有效的设计形成了一个简洁的框架,无需额外的矫正模块或字符级标注即可处理任意形状的文本。此外,通过引入框选择调度,检测器的参数大幅减少且性能未下降。定性与定量实验表明,SwinTextSpotter v2 在多种多语言(英文、中文、越南文)基准测试上达到了最先进的性能。代码将发布于 https://github.com/mxin262/SwinTextSpotterv2。

关键词

引用

@article{arxiv.2401.07641,
  title  = {SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting},
  author = {Mingxin Huang and Dezhi Peng and Hongliang Li and Zhenghao Peng and Chongyu Liu and Dahua Lin and Yuliang Liu and Xiang Bai and Lianwen Jin},
  journal= {arXiv preprint arXiv:2401.07641},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2203.10209