中文

Polygon-free:基于框标注的无约束场景文本检测

计算机视觉与模式识别 2022-05-27 v3

摘要

尽管多边形比直立边界框更能准确表示文本检测中的文本,但多边形标注极其昂贵且具挑战性。与使用多边形标注进行全监督训练的现有工作不同,本研究提出一种称为 Polygon-free(PF)的无约束文本检测系统,其中大多数现有的基于多边形的文本检测器(如 PSENet [33]、DB [16])仅使用直立边界框标注进行训练。我们的核心思想是将知识从合成数据迁移到真实数据,以增强直立边界框的监督信息。这通过一个简单的分割网络实现,即骨架注意力分割网络(SASN),其包含三个关键组件(即通道注意力、空间注意力和骨架注意力图)以及一个软交叉熵损失。实验表明,所提出的 Polygon-free 系统可结合通用检测器(如 EAST、PSENet、DB),在多个数据集(如 ICDAR2019-Art、TotalText、ICDAR2015)上仅用直立边界框标注即生成令人惊讶的高质量像素级结果。例如,在不使用多边形标注的情况下,PSENet 在 TotalText [3] 上取得 80.5% 的 F-score(全监督对应方法为 80.9%),比直接用直立边界框标注训练高出 31.1%,并节省 80% 以上的标注成本。我们希望 PF 能为降低标注成本的文本检测提供新视角。代码见 https://github.com/weijiawu/Unconstrained-Text-Detection-with-Box-Supervisionand-Dynamic-Self-Training。

关键词

引用

@article{arxiv.2011.13307,
  title  = {Polygon-free: Unconstrained Scene Text Detection with Box Annotations},
  author = {Weijia Wu and Enze Xie and Ruimao Zhang and Wenhai Wang and Hong Zhou and Ping Luo},
  journal= {arXiv preprint arXiv:2011.13307},
  year   = {2022}
}