中文

Spotlight Text Detector:如相机般聚焦候选区域

计算机视觉与模式识别 2024-09-26 v1

摘要

不规则轮廓表示是场景文本检测中的难题之一。尽管基于分割的方法在灵活像素预测的帮助下取得了显著进展,但地理位置相近的文本重叠阻碍了对它们的分别检测。为缓解此问题,一些基于收缩的方法预测文本核并将其扩展以重构文本。然而,文本核是具有不完整语义特征的人造目标,容易导致错误或遗漏检测。此外,与一般目标不同,场景文本的几何特征(长宽比、尺度与形状)差异显著,这使得难以准确检测它们。为综合考虑上述问题,我们提出了一种有效的 spotlight text detector (STD),它由 spotlight calibration module (SCM) 和 multivariate information extraction module (MIEM) 组成。前者将精力集中在候选核上,如同相机聚焦目标。它通过映射滤波器获取候选特征并对其进行精确校准,以消除部分假阳性样本。后者设计了不同的形状方案以探索场景文本的多种几何特征。它有助于提取各种空间关系,从而提高模型识别核区域的能力。消融实验证明了所设计的 SCM 和 MIEM 的有效性。大量实验验证了我们的 STD 在包括 ICDAR2015、CTW1500、MSRA-TD500 和 Total-Text 在内的多种数据集上优于现有的 state-of-the-art 方法。

关键词

引用

@article{arxiv.2409.16820,
  title  = {Spotlight Text Detector: Spotlight on Candidate Regions Like a Camera},
  author = {Xu Han and Junyu Gao and Chuang Yang and Yuan Yuan and Qi Wang},
  journal= {arXiv preprint arXiv:2409.16820},
  year   = {2024}
}