探索无序框离散化网络在多方向场景文本检测中的能力
计算机视觉与模式识别
2021-01-19 v3
摘要
多方向场景文本检测近来获得了显著的研究关注。先前的方法通常通过使用四边形形状直接预测单词或文本行。然而,这些方法中的许多忽视了标注一致性的重要性,而这对于维持稳定的训练过程十分重要,尤其是在包含大量数据时。在此我们通过提出一种新方法——无序框离散化(OBD)来解决该问题,该方法首先将四边形框离散化为若干包含全部潜在水平与垂直位置的关键边。为解码准确的顶点位置,提出了一种简单而有效的匹配过程用于重建四边形边界框。我们的方法解决了对学习过程有显著影响的歧义问题。我们进行了广泛的消融研究以定量验证所提方法的有效性。更重要的是,基于OBD,我们详细分析了一系列改进措施的影响,这可能启发他人构建最先进的文本检测器。结合OBD与这些有用改进,我们在包括ICDAR 2015和MLT在内的多个基准上取得了最先进的性能。我们的方法还在最近的ICDAR2019鲁棒阅读挑战赛——招牌中文文本阅读的文本检测任务中获得第一名,进一步证明了其优越性能。代码见 https://git.io/TextDet。
引用
@article{arxiv.1912.09629,
title = {Exploring the Capacity of an Orderless Box Discretization Network for Multi-orientation Scene Text Detection},
author = {Yuliang Liu and Tong He and Hao Chen and Xinyu Wang and Canjie Luo and Shuaitao Zhang and Chunhua Shen and Lianwen Jin},
journal= {arXiv preprint arXiv:1912.09629},
year = {2021}
}