中文

基于无顺序框离散化的全向场景文本检测

计算机视觉与模式识别 2019-07-30 v3

摘要

自然场景中的文本通常呈现出高度多变的特性。使用四边形边界框来定位文本实例对于检测方法几乎是不可或缺的。然而,近期研究揭示,为场景文本检测引入四边形边界框会带来一个易被忽视的标签混淆问题,该问题可能严重损害检测性能。为解决此问题,本文提出一种称为无顺序框离散化(Sequential-free Box Discretization, SBD)的新方法,将边界框离散化为关键边(KE),并可进一步导出更有效的方法来提升检测性能。实验表明,所提方法在包括 ICDAR 2015、MLT 与 MSRA-TD500 在内的多个流行场景文本基准上优于 SOTA 方法。消融研究还表明,仅将 SBD 集成到 Mask R-CNN 框架中,检测性能即可大幅提升。此外,在通用目标数据集 HRSC2016(多方向船舶)上的实验表明,我们的方法大幅优于近期 SOTA 方法,展示了其强大的泛化能力。源代码:https://github.com/Yuliang-Liu/Box_Discretization_Network。

关键词

引用

@article{arxiv.1906.02371,
  title  = {Omnidirectional Scene Text Detection with Sequential-free Box Discretization},
  author = {Yuliang Liu and Sheng Zhang and Lianwen Jin and Lele Xie and Yaqiang Wu and Zhepeng Wang},
  journal= {arXiv preprint arXiv:1906.02371},
  year   = {2019}
}

备注

Accepted by IJCAI2019