中文

迈向无约束的端到端文本检测与识别

计算机视觉与模式识别 2019-08-27 v1

摘要

我们提出了一种可端到端训练的神经网络,能够同时检测并识别任意形状的文本,在读取不规则形状场景文本的开放性问题上取得了实质性进展。我们将任意形状文本检测表述为一个实例分割问题;随后使用注意力模型在不进行校正的情况下解码每个不规则形状文本区域的文本内容。为从图像尺度特征中提取有用的不规则形状文本实例特征,我们提出了一种简单而有效的 RoI 掩蔽步骤。此外,我们表明现有多步 OCR 引擎的预测可作为部分标注的训练数据,这带来了我们模型在检测和识别准确率上的显著提升。我们的方法在 ICDAR15(直文本)基准上端到端识别任务上超越了最先进水平 4.6%,在 Total-Text(曲文本)基准上超越超过 16%。

关键词

引用

@article{arxiv.1908.09231,
  title  = {Towards Unconstrained End-to-End Text Spotting},
  author = {Siyang Qin and Alessandro Bissacco and Michalis Raptis and Yasuhisa Fujii and Ying Xiao},
  journal= {arXiv preprint arXiv:1908.09231},
  year   = {2019}
}

备注

Accepted to ICCV 2019 as oral presentation