ReLaText:利用图卷积网络挖掘视觉关系实现任意形状场景文本检测
计算机视觉与模式识别
2020-03-17 v1
摘要
我们提出了一种名为 ReLaText 的任意形状文本检测新方法,将文本检测表述为视觉关系检测问题。为证明这一新表述的有效性,我们首先利用“连接”关系解决具有挑战性的文本行分组问题。其核心思想是将文本检测分解为两个子问题,即文本基元的检测与邻近文本基元对之间连接关系的预测。具体而言,首先使用基于无锚区域提议网络的文本检测器从特征金字塔网络的不同特征图中检测不同尺度的文本基元,并将同一特征图检测到的每对邻近文本基元以边相连,构建文本基元图。随后,采用基于图卷积网络(GCN)的连接关系预测模块修剪文本基元图中的错误连接边,生成若干不相交子图,每个子图代表一个检测到的文本实例。由于 GCN 能有效利用上下文信息提升连接预测精度,我们基于 GCN 的文本行分组方法可比以往方法取得更好的文本检测精度,尤其在处理字符间距大或行间距极小的文本实例时。因此,所提 ReLaText 在 RCTW-17、MSRA-TD500、Total-Text、CTW1500 和 DAST1500 五个公开文本检测基准上达到了最先进的性能。
引用
@article{arxiv.2003.06999,
title = {ReLaText: Exploiting Visual Relationships for Arbitrary-Shaped Scene Text Detection with Graph Convolutional Networks},
author = {Chixiang Ma and Lei Sun and Zhuoyao Zhong and Qiang Huo},
journal= {arXiv preprint arXiv:2003.06999},
year = {2020}
}