中文

Mask TextSpotter:一种用于任意形状文本定位的端到端可训练神经网络

计算机视觉与模式识别 2018-08-02 v2

摘要

近来,基于深度神经网络的模型已主导场景文本检测与识别领域。本文中,我们研究场景文本定位问题,其旨在自然图像中同时进行文本检测与识别。我们提出了一种用于场景文本定位的端到端可训练神经网络模型。所提模型名为 Mask TextSpotter,受新近发表的 Mask R-CNN 工作启发。与同样以端到端可训练深度神经网络完成文本定位的先前方法不同,Mask TextSpotter 利用简单平滑的端到端学习过程,通过语义分割获得精确文本检测与识别。此外,其在处理不规则形状文本实例(例如弯曲文本)上优于先前方法。在 ICDAR2013、ICDAR2015 和 Total-Text 上的实验表明,所提方法在场景文本检测与端到端文本识别任务中均达到最先进(state-of-the-art, SOTA)结果。

关键词

引用

@article{arxiv.1807.02242,
  title  = {Mask TextSpotter: An End-to-End Trainable Neural Network for Spotting Text with Arbitrary Shapes},
  author = {Pengyuan Lyu and Minghui Liao and Cong Yao and Wenhao Wu and Xiang Bai},
  journal= {arXiv preprint arXiv:1807.02242},
  year   = {2018}
}

备注

To appear in ECCV 2018