WordSup:利用词级标注进行基于字符的文本检测
计算机视觉与模式识别
2017-08-23 v1
摘要
图像文本通常组织为由若干视觉元素(即字符、词、文本行和文本块)构成的层级结构。在这些元素中,字符是各种语言(如西方语言、中文、日文、数学表达式等)中最基本的元素。基于字符检测器构建通用文本检测引擎是自然且便捷的。然而,训练字符检测器需要大量带有位置标注的字符,而获取这些标注成本高昂。实际上,现有的真实文本数据集大多在词级或行级进行标注。为解决这一困境,我们提出了一种弱监督框架,该框架能够利用词级标注(无论是紧密四边形还是更宽松的边界框)来训练字符检测器。将其应用于场景文本检测时,我们便能够通过利用丰富的大规模真实场景文本数据集(如 ICDAR15 和 COCO-text)中的词级标注,训练出鲁棒的字符检测器。字符检测器在我们的文本检测引擎流水线中扮演关键角色。它在多个极具挑战性的场景文本检测基准上取得了 SOTA 的性能。我们还通过各种场景展示了我们流水线的灵活性,包括变形文本检测和数学表达式识别。
引用
@article{arxiv.1708.06720,
title = {WordSup: Exploiting Word Annotations for Character based Text Detection},
author = {Han Hu and Chengquan Zhang and Yuxuan Luo and Yuzhuo Wang and Junyu Han and Errui Ding},
journal= {arXiv preprint arXiv:1708.06720},
year = {2017}
}
备注
2017 International Conference on Computer Vision