中文

TextRay:基于轮廓的几何建模用于任意形状场景文本检测

计算机视觉与模式识别 2020-08-13 v2 机器学习

摘要

任意形状文本检测是一项具有挑战性的任务,因为文本具有大长宽比、多尺度、随机旋转和曲线形状等复杂几何布局。大多数最先进的方法从自下而上的视角解决该问题,试图用简单的局部单元(如局部框或像素)对复杂几何布局的文本实例建模,并通过启发式后处理生成检测结果。在本工作中,我们提出一种任意形状文本检测方法,称为 TextRay,其在单阶段无锚框框架内执行自上而下的基于轮廓的几何建模与几何参数学习。该几何建模在极坐标系下通过形状空间与参数空间之间的双向映射方案进行,将复杂几何布局编码为统一表示。为有效学习这些表示,我们设计了中心加权训练策略和内容损失,在几何编码与视觉内容之间建立传播路径。TextRay 仅通过一次 NMS 后处理即可单遍输出简单多边形检测。在多个基准数据集上的实验证明了所提方法的有效性。代码见 https://github.com/LianaWang/TextRay。

关键词

引用

@article{arxiv.2008.04851,
  title  = {TextRay: Contour-based Geometric Modeling for Arbitrary-shaped Scene Text Detection},
  author = {Fangfang Wang and Yifeng Chen and Fei Wu and Xi Li},
  journal= {arXiv preprint arXiv:2008.04851},
  year   = {2020}
}

备注

Accepted to ACM MM 2020