自然场景中的曲线文本检测:新数据集与新方案
计算机视觉与模式识别
2017-12-07 v1
摘要
场景文本检测近年来取得了巨大进展。检测方式已从轴对齐矩形演进到旋转矩形,并进一步发展到四边形。然而,当前数据集中包含极少曲线文本,而曲线文本在招牌、产品名等场景图像中广泛存在。为引起对自然场景中曲线文本读取的关注,本文构建了一个名为 CTW1500 的曲线文本数据集,包含 1500 张图像(1000 张训练、500 张测试)中超过 1 万条文本标注。基于该数据集,我们开创性地提出了一种基于多边形的曲线文本检测器(CTD),可直接检测曲线文本而无需经验性组合。此外,通过无缝集成递归横向与纵向偏移连接(TLOC),所提方法可端到端训练以学习位置偏移间的内在联系。这使得 CTD 能够利用上下文信息而非独立预测各点,从而获得更平滑且更准确的检测。我们还提出了两种简单而有效的后处理方法,即非多边形抑制(NPS)与多边形非极大值抑制(PNMS),以进一步提升检测精度。此外,本文方法以通用方式设计,也可无需额外代价地使用矩形或四边形边界框训练。在 CTW-1500 上的实验结果表明,仅使用轻量骨干网络的我们的方法大幅优于 SOTA 方法。仅在曲线或非曲线子集上评测时,CTD + TLOC 仍取得最佳结果。代码见 https://github.com/Yuliang-Liu/Curve-Text-Detector。
引用
@article{arxiv.1712.02170,
title = {Detecting Curve Text in the Wild: New Dataset and New Solution},
author = {Liu Yuliang and Jin Lianwen and Zhang Shuaitao and Zhang Sheng},
journal= {arXiv preprint arXiv:1712.02170},
year = {2017}
}
备注
9 pages