中文

CentripetalText:一种用于场景文本检测的高效文本实例表示

计算机视觉与模式识别 2022-01-19 v3

摘要

由于文本曲率、方向和长宽比的变化,场景文本检测仍是一项重大挑战。该任务中最困难的问题之一是如何表示任意形状的文本实例。尽管已提出许多方法来灵活建模不规则文本,但它们大多丧失了简洁性与鲁棒性。其复杂的后处理以及在 Dirac delta 分布下的回归损害了检测性能与泛化能力。本文中,我们提出一种称为 CentripetalText(CT)的高效文本实例表示,将文本实例分解为文本核与向心偏移的组合。具体而言,我们利用向心偏移实现像素聚合,引导外部文本像素至内部文本核。松弛操作被集成到向心偏移的密集回归中,允许在某一范围内而非特定值上正确预测。我们方法中文本轮廓的便捷重建与预测误差的容忍度分别保证了高检测精度与快速推理速度。此外,我们将文本检测器缩减为候选生成模块,即 CentripetalText Proposal Network,替换 Mask TextSpotter v3 中的 Segmentation Proposal Network 并生成更准确的候选。为验证方法有效性,我们在多个常用场景文本基准上开展实验,包括弯曲与多方向文本数据集。对于场景文本检测任务,我们的方法相较其他现有方法取得了更优或具竞争力的性能,例如在 Total-Text 上以 40.0 FPS 取得 86.3% 的 F 值,在 MSRA-TD500 上以 34.8 FPS 取得 86.1% 的 F 值等。对于端到端场景文本识别任务,我们的方法在 Total-Text 上以 1.1% 优于 Mask TextSpotter v3。

关键词

引用

@article{arxiv.2107.05945,
  title  = {CentripetalText: An Efficient Text Instance Representation for Scene Text Detection},
  author = {Tao Sheng and Jie Chen and Zhouhui Lian},
  journal= {arXiv preprint arXiv:2107.05945},
  year   = {2022}
}

备注

Accepted by NeurIPS 2021