一种用于自然场景任意形状文本检测并改进文本识别的方法
计算机视觉与模式识别
2020-05-29 v3
摘要
理解自然场景图像(如高速公路标志或店面徽标)中文本的含义尤其具有挑战性,如果文本在图像中发生透视缩短或字母被艺术化扭曲。我们引入了一个基于流水线的文本识别(text spotting)框架,能够在具有复杂背景的自然场景图像中检测和识别各种字体、形状和方向的文本。我们工作的主要贡献是文本检测组件,我们称之为 UHT(UNet、Heatmap 和 Textfill 的缩写)。UHT 使用 UNet 计算候选文本区域的热图(heatmap),并使用 textfill 算法在每个候选文本单词周围生成紧密的多边形边界。我们的方法使用由真实标注(groundtruth annotations)提供的文本边界多边形获得的真实热图来训练 UNet。我们的文本识别框架称为 UHTA,将 UHT 与最先进的文本识别系统 ASTER 相结合。在四个具有挑战性的公开场景文本检测数据集(Total-Text、SCUT-CTW1500、MSRA-TD500 和 COCO-Text)上的实验表明了 UHT 在检测多语言(可能旋转)直排文本以及多种语言书写的弯曲文本方面的有效性和泛化能力。我们的 UHTA 在 Total-Text 数据集上的实验结果表明,UHTA 在 F-measure 上至少优于四个最先进的文本识别框架 9.1 个百分点,这表明 UHTA 可用作实际应用中的完整文本检测与识别系统。
引用
@article{arxiv.1911.07046,
title = {A method for detecting text of arbitrary shapes in natural scenes that improves text spotting},
author = {Qitong Wang and Yi Zheng and Margrit Betke},
journal= {arXiv preprint arXiv:1911.07046},
year = {2020}
}
备注
Accepted by IEEE CVPR-W 2020