CORE-Text:基于对比关系推理改进场景文本检测
计算机视觉与模式识别
2021-12-15 v1 人工智能
多媒体
摘要
在自然场景中定位文本实例被视为计算机视觉中的基础挑战。然而,由于真实场景中文本实例的宽高比和尺度极度多变,大多数传统文本检测器受困于子文本问题,即仅定位文本实例的片段(即子文本)。本工作中,我们定量分析了子文本问题,并提出了一种简单而有效的设计——对比关系(CORE)模块,以缓解该问题。CORE 首先利用朴素关系块对所有文本候选框(多个文本实例的子文本)间的关系建模,并进一步通过实例级子文本判别以对比方式增强关系推理。这种方式自然学习到文本候选框的实例感知表示,从而助力场景文本检测。我们将 CORE 模块集成到 Mask R-CNN 的两阶段文本检测器中,并设计出我们的文本检测器 CORE-Text。在四个基准上的大量实验证明了 CORE-Text 的优越性。代码见:\url{https://github.com/jylins/CORE-Text}。
引用
@article{arxiv.2112.07513,
title = {CORE-Text: Improving Scene Text Detection with Contrastive Relational Reasoning},
author = {Jingyang Lin and Yingwei Pan and Rongfeng Lai and Xuehang Yang and Hongyang Chao and Ting Yao},
journal= {arXiv preprint arXiv:2112.07513},
year = {2021}
}
备注
ICME 2021 (Oral); Code is publicly available at: https://github.com/jylins/CORE-Text