中文

基于全局级与词级特征的实时场景文本检测

计算机视觉与模式识别 2022-03-11 v1

摘要

在自然场景中以高精度和高效率检测任意形状文本是一项极具挑战性的任务。本文提出一种场景文本检测框架,即 GWNet,主要包括两个模块:全局模块和 RCNN 模块。具体而言,全局模块通过添加 k 子模块和 shift 子模块改进 DB(可微分二值化)模块的自适应性能。两个子模块增强了放大因子 k 的适应性,加速模型收敛并有助于产生更准确的检测结果。RCNN 模块融合全局级和词级特征。词级标签通过获取收缩多边形的最小轴对齐矩形框生成。在推理阶段,GWNet 仅使用全局级特征输出简单多边形检测。在包括 MSRA-TD500、Total-Text、ICDAR2015 和 CTW-1500 在内的四个基准数据集上的实验表明,我们的 GWNet 优于最先进的检测器。具体而言,以 ResNet-50 为骨干网络,我们在 MSRA-TD500 上达到 88.6% 的 F 值,在 Total-Text 上 87.9%,在 ICDAR2015 上 89.2%,在 CTW-1500 上 87.5%。

关键词

引用

@article{arxiv.2203.05251,
  title  = {Real-time Scene Text Detection Based on Global Level and Word Level Features},
  author = {Fuqiang Zhao and Jionghua Yu and Enjun Xing and Wenming Song and Xue Xu},
  journal= {arXiv preprint arXiv:2203.05251},
  year   = {2022}
}