中文

CORE-Text:基于对比关系推理改进场景文本检测

计算机视觉与模式识别 2021-12-15 v1 人工智能 多媒体

摘要

在自然场景中定位文本实例被视为计算机视觉中的基础挑战。然而,由于真实场景中文本实例的宽高比和尺度极度多变,大多数传统文本检测器受困于子文本问题,即仅定位文本实例的片段(即子文本)。本工作中,我们定量分析了子文本问题,并提出了一种简单而有效的设计——对比关系(CORE)模块,以缓解该问题。CORE 首先利用朴素关系块对所有文本候选框(多个文本实例的子文本)间的关系建模,并进一步通过实例级子文本判别以对比方式增强关系推理。这种方式自然学习到文本候选框的实例感知表示,从而助力场景文本检测。我们将 CORE 模块集成到 Mask R-CNN 的两阶段文本检测器中,并设计出我们的文本检测器 CORE-Text。在四个基准上的大量实验证明了 CORE-Text 的优越性。代码见:\url{https://github.com/jylins/CORE-Text}。

关键词

引用

@article{arxiv.2112.07513,
  title  = {CORE-Text: Improving Scene Text Detection with Contrastive Relational Reasoning},
  author = {Jingyang Lin and Yingwei Pan and Rongfeng Lai and Xuehang Yang and Hongyang Chao and Ting Yao},
  journal= {arXiv preprint arXiv:2112.07513},
  year   = {2021}
}

备注

ICME 2021 (Oral); Code is publicly available at: https://github.com/jylins/CORE-Text