中文

位置感知特征选择文本检测网络

计算机视觉与模式识别 2020-05-27 v2

摘要

基于回归的文本检测方法凭借简单的网络结构和较高的效率已经取得了令人满意的性能。然而,与近期基于分割的文本检测器相比,它们在准确性上落后了。在这项工作中,我们发现造成这种情况的一个重要原因是,基于回归的方法通常采用固定的特征选择方式,即在单一位置或邻近区域选择特征,来预测边界框的各个组件,例如到边界的距离或旋转角度。通过这种方式选择的特征有时并不是预测文本边界框每个组件的最佳选择,从而降低了准确率性能。为了解决这个问题,我们提出了一种新颖的位置感知特征选择文本检测网络(LASNet)。LASNet 从不同位置选择合适的特征来分别预测边界框的五个组件,并通过这些组件的组合得到最终的边界框。具体而言,与大多数现有方法使用分类得分图选择一个特征来预测整个边界框不同,所提出的 LASNet 首先学习五个新的置信度得分图,分别指示边界框组件的预测准确性。然后,设计了一种位置感知特征选择机制(LAFS),根据置信度得分对每个组件的前 KK 个预测结果进行加权融合,并将所有五个融合组件组合成最终的边界框。因此,LASNet 通过使用可学习的特征选择方式预测出更准确的边界框。实验结果表明,我们的 LASNet 在单模型和单尺度测试下实现了最先进的性能,优于所有现有的基于回归的检测器。

关键词

引用

@article{arxiv.2004.10999,
  title  = {Location-Aware Feature Selection Text Detection Network},
  author = {Zengyuan Guo and Zilin Wang and Zhihui Wang and Wanli Ouyang and Haojie Li and Wen Gao},
  journal= {arXiv preprint arXiv:2004.10999},
  year   = {2020}
}

备注

10 pages, 7 figures, 5 tables