中文

基于深度字符嵌入网络的自然场景文本检测

计算机视觉与模式识别 2019-01-03 v1

摘要

大多数文本检测方法假设文本是水平的或多方向的,从而将四边形定义为基本的检测单元。然而,自然场景中的文本通常具有透视畸变或弯曲,现有方法难以轻松处理。在本文中,我们提出了一种深度字符嵌入网络(CENet),该网络同时预测字符的边界框及其嵌入向量,从而将文本检测转化为字符嵌入空间中简单的聚类任务。所提出的方法不需要对一般文本检测做出形成直线的强假设,这为任意弯曲或透视畸变的文本提供了灵活性。对于字符检测任务,设计了一个密集预测子网络来获取字符的置信度分数和边界框。对于字符嵌入任务,训练了一个带有对比损失的子网络,以将检测到的字符投影到嵌入空间中。这两个任务共享一个骨干 CNN,从中提取多尺度特征图。通过对字符置信度和字符对的嵌入距离进行阈值处理,可以轻松获得最终的文本区域。我们在 ICDAR13、ICDAR15、MSRA-TD500 和 Total-Text 上评估了我们的方法。所提出的方法在所有这些数据集上均实现了 SOTA 或可比的性能,并在不规则文本数据集(即 Total-Text)上显示出显著提升。

关键词

引用

@article{arxiv.1901.00363,
  title  = {Detecting Text in the Wild with Deep Character Embedding Network},
  author = {Jiaming Liu and Chengquan Zhang and Yipeng Sun and Junyu Han and Errui Ding},
  journal= {arXiv preprint arXiv:1901.00363},
  year   = {2019}
}

备注

Asian Conference on Computer Vision 2018