中文

金字塔掩码文本检测器

计算机视觉与模式识别 2019-03-29 v1

摘要

场景文本检测是场景文本识别系统的重要步骤,旨在自然场景图像中自动定位文本实例。近期一些受益于 Mask R-CNN 的尝试将场景文本检测任务表述为实例分割问题并取得了卓越性能。本文提出一种基于 Mask R-CNN 的新框架,名为金字塔掩码文本检测器(PMTD),以处理场景文本检测。与现有基于 Mask R-CNN 方法生成的二值文本掩码不同,我们的 PMTD 在位置感知监督指导下进行像素级回归,为每个文本实例生成信息更丰富的软文本掩码。对于文本框的生成,PMTD 将获得的二维软掩码重新解释至三维空间,并引入一种新颖的平面聚类算法,基于三维形状推导最优文本框。在标准数据集上的实验表明,所提 PMTD 带来一致且显著的增益,并明显优于当前最优方法。具体而言,它在 ICDAR 2017 MLT 数据集上取得了 80.13% 的 F 值。

关键词

引用

@article{arxiv.1903.11800,
  title  = {Pyramid Mask Text Detector},
  author = {Jingchao Liu and Xuebo Liu and Jie Sheng and Ding Liang and Xin Li and Qingjie Liu},
  journal= {arXiv preprint arXiv:1903.11800},
  year   = {2019}
}