中文

EK-Net:基于扩展核距离的实时场景文本检测

计算机视觉与模式识别 2024-01-23 v1

摘要

近年来,场景文本检测因其广泛的应用而受到极大关注。然而,在多尺度、多方向和弯曲的复杂场景中实现准确检测仍然是一个挑战。许多检测方法采用 Vatti 裁剪(VC)算法进行多实例训练,以解决任意形状文本的问题。然而,我们发现这些方法存在几种偏差结果,称为“收缩核”。具体而言,这是指由于输出过度偏向文本核而导致的精度下降。在本文中,我们提出了一种名为扩展核网络(EK-Net)的新方法,通过扩展核距离来弥补之前的不足,该方法包含三阶段回归以完成实例检测。此外,EK-Net 不仅实现了任意形状文本的精确定位,还在性能与速度之间取得了平衡。评估结果表明,与其他先进方法相比,EK-Net 达到了最先进或具有竞争力的性能,例如在 ICDAR 2015 数据集上以 35.42 FPS 的速度达到 85.72% 的 F-measure,在 CTW1500 数据集上以 40.13 FPS 的速度达到 85.75% 的 F-measure。

关键词

引用

@article{arxiv.2401.11704,
  title  = {EK-Net:Real-time Scene Text Detection with Expand Kernel Distance},
  author = {Boyuan Zhu and Fagui Liu and Xi Chen and Quan Tang},
  journal= {arXiv preprint arXiv:2401.11704},
  year   = {2024}
}

备注

2024 IEEE International Conference on Acoustics, Speech and Signal Processing