中文

一种任意形状场景文本识别的可行框架

计算机视觉与模式识别 2019-12-13 v2

摘要

基于深度学习的方法在场景文本识别(STR,计算机视觉中的经典问题之一)方面取得了令人惊讶的进展。在本文中,我们提出了一种面向多语言任意形状 STR 的可行框架,包括基于实例分割的文本检测与基于语言模型的注意力机制用于文本识别。我们的 STR 算法不仅识别拉丁与非拉丁字符,还支持任意形状文本识别。我们的方法在 ICDAR2019 任意形状文本鲁棒阅读挑战赛的场景文本定位任务(仅拉丁、拉丁与中文)上获得冠军。代码见 https://github.com/zhang0jhon/AttentionOCR。

关键词

引用

@article{arxiv.1912.04561,
  title  = {A Feasible Framework for Arbitrary-Shaped Scene Text Recognition},
  author = {Jinjin Zhang and Wei Wang and Di Huang and Qingjie Liu and Yunhong Wang},
  journal= {arXiv preprint arXiv:1912.04561},
  year   = {2019}
}