中文

卷积字符网络

计算机视觉与模式识别 2019-10-18 v1

摘要

近期在开发自然图像中文本检测与识别联合统一框架方面取得了进展,但现有的联合模型大多基于涉及ROI池化的两阶段框架构建,这会降低识别任务的性能。在本工作中,我们提出卷积字符网络,称为CharNet,这是一种单阶段模型,可一次性同时处理两项任务。CharNet直接输出单词和字符的边界框及相应的字符标签。我们以字符为基本单元,从而克服了现有方法试图用基于RNN的识别分支联合优化文本检测的主要困难。此外,我们开发了一种迭代字符检测方法,能够将合成数据上学到的字符检测能力迁移到真实世界图像。这些技术改进带来了一种简单、紧凑但强大的单阶段模型,可可靠地用于多方向和弯曲文本。我们在三个标准基准上评估了CharNet,它始终大幅优于最先进的方法[25, 24],例如在ICDAR 2015上端到端文本识别(使用通用词典)从65.33%提升到71.08%,在Total-Text上从54.0%提升到69.23%。代码见:https://github.com/MalongTech/research-charnet。

关键词

引用

@article{arxiv.1910.07954,
  title  = {Convolutional Character Networks},
  author = {Linjie Xing and Zhi Tian and Weilin Huang and Matthew R. Scott},
  journal= {arXiv preprint arXiv:1910.07954},
  year   = {2019}
}

备注

To appear in ICCV 2019