多次观察:一种任意形状文本的精确检测器
计算机视觉与模式识别
2019-04-16 v1
摘要
以往的的场景文本检测方法在过去几年中取得了实质性进展。然而,受限于 CNN 的感受野以及用于描述文本的矩形边界框或四边形等简单表示,以往方法在处理更具挑战性的文本实例(如极长文本和任意形状文本)时可能力有不逮。为解决这两个问题,我们提出一种新颖的文本检测器 LOMO,它多次渐进式地定位文本(换言之,Look More than Once)。LOMO 由直接回归器(DR)、迭代细化模块(IRM)和形状表达模块(SEM)组成。首先,DR 分支生成四边形形式的文本提议。接着,IRM 基于初步提议提取的特征块,通过迭代细化逐步感知整个长文本。最后,引入 SEM,通过考虑文本实例的几何属性(包括文本区域、文本中心线和边界偏移)来重建不规则文本的更精确表示。在包括 ICDAR2017-RCTW、SCUT-CTW1500、Total-Text、ICDAR2015 和 ICDAR17-MLT 在内的多个公开基准上的最优结果证实了 LOMO 显著的鲁棒性和有效性。
引用
@article{arxiv.1904.06535,
title = {Look More Than Once: An Accurate Detector for Text of Arbitrary Shapes},
author = {Chengquan Zhang and Borong Liang and Zuming Huang and Mengyi En and Junyu Han and Errui Ding and Xinghao Ding},
journal= {arXiv preprint arXiv:1904.06535},
year = {2019}
}
备注
Accepted by CVPR19