SwinTextSpotter:通过文本检测与识别间更优协同实现场景文本定位
计算机视觉与模式识别
2022-03-22 v1
摘要
近年来,端到端场景文本定位因成功挖掘了场景文本检测与识别之间的内在协同而备受关注。然而,当前最先进的方法通常仅通过共享主干网络来结合检测与识别,并未直接利用两个任务之间的特征交互。本文提出一种新的端到端场景文本定位框架,名为 SwinTextSpotter。我们以带有动态头部的 Transformer 编码器作为检测器,并通过一种新颖的识别转换机制统一两个任务,从而利用识别损失显式地引导文本定位。这种简洁的设计形成了一个精简的框架,无需额外的矫正模块,也无需对任意形状文本进行字符级标注。在多方向数据集 RoIC13 和 ICDAR 2015、任意形状数据集 Total-Text 和 CTW1500,以及多语言数据集 ReCTS(中文)和 VinText(越南文)上的定性与定量实验表明,SwinTextSpotter 显著优于现有方法。代码已开源:https://github.com/mxin262/SwinTextSpotter。
引用
@article{arxiv.2203.10209,
title = {SwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text Recognition},
author = {Mingxin Huang and Yuliang Liu and Zhenghao Peng and Chongyu Liu and Dahua Lin and Shenggao Zhu and Nicholas Yuan and Kai Ding and Lianwen Jin},
journal= {arXiv preprint arXiv:2203.10209},
year = {2022}
}
备注
Accepted to be appeared in CVPR 2022