中文

I3CL:用于任意形状场景文本检测的实例内与实例间协同学习

计算机视觉与模式识别 2022-04-21 v3

摘要

现有的自然场景中任意形状文本检测方法面临两个关键问题,即:1) 文本实例间隙处的断裂检测;以及 2) 对具有多样背景上下文的任意形状文本实例的检测不准确。为解决这些问题,我们提出了一种名为实例内与实例间协同学习 (I3CL) 的新方法。具体而言,为解决第一个问题,我们设计了一个具有多个感受野的有效卷积模块,该模块能够在文本实例内部局部和长距离范围内协同学习更好的字符和间隙特征表示。为解决第二个问题,我们设计了一个基于实例的 Transformer 模块来利用不同文本实例之间的依赖关系,以及一个全局上下文模块来利用共享背景中的语义上下文,这两个模块能够协同学习更具判别性的文本特征表示。通过这种方式,I3CL 能够在一个统一的端到端可训练框架中有效利用实例内和实例间的依赖关系。此外,为了充分利用未标注数据,我们设计了一种有效的半监督学习方法,通过集成策略利用伪标签。在没有额外技巧的情况下,实验结果表明,所提出的 I3CL 在三个具有挑战性的公共基准数据集上取得了新的最先进结果,即 ICDAR2019-ArT 上的 F-measure 为 77.5%,Total-Text 上为 86.9%,CTW-1500 上为 86.4%。值得注意的是,我们采用 ResNeSt-101 骨干网络的 I3CL 在 ICDAR2019-ArT 排行榜上排名第一。源代码将发布于 https://github.com/ViTAE-Transformer/ViTAE-Transformer-Scene-Text-Detection。

关键词

引用

@article{arxiv.2108.01343,
  title  = {I3CL:Intra- and Inter-Instance Collaborative Learning for Arbitrary-shaped Scene Text Detection},
  author = {Bo Du and Jian Ye and Jing Zhang and Juhua Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2108.01343},
  year   = {2022}
}

备注

IJCV. Code is available at https://github.com/ViTAE-Transformer/ViTAE-Transformer-Scene-Text-Detection