中文

一种用于图像中文本定位与识别的多任务网络

计算与语言 2019-06-25 v1 计算机视觉与模式识别

摘要

我们提出了一种端到端可训练的多任务网络,解决复杂文档中无词典文本提取的问题。该网络同时解决文本定位和文本识别问题,文本片段的识别无需后处理、裁剪或词语分组。我们将卷积主干网络与特征金字塔网络相结合,提供共享表征以惠及三个模型头:文本定位、分类和文本识别。为提高识别准确率,我们描述了一种动态池化机制,在所有RoI上保留高分辨率信息。对于文本识别,我们提出了一种带注意力的卷积机制,其性能优于更常见的循环架构。我们的模型在基准数据集和可比方法上进行了评估,并在非传统OCR的困难场景下取得了高性能。

关键词

引用

@article{arxiv.1906.09266,
  title  = {A Multitask Network for Localization and Recognition of Text in Images},
  author = {Mohammad Reza Sarshogh and Keegan E. Hines},
  journal= {arXiv preprint arXiv:1906.09266},
  year   = {2019}
}

备注

ICDAR 2019