中文

面向精确场景文本识别的语义推理网络

计算机视觉与模式识别 2020-03-30 v1

摘要

场景文本图像包含两层内容:视觉纹理与语义信息。尽管以往的 scene text recognition(场景文本识别)方法在过去几年中取得了巨大进展,但关于挖掘语义信息以辅助文本识别的研究较少受到关注,仅有类 RNN 结构被探索用于隐式建模语义信息。然而,我们观察到基于 RNN 的方法存在一些明显缺陷,例如时间依赖的解码方式以及语义上下文的单向串行传输,这极大限制了语义信息的帮助与计算效率。为缓解这些局限,我们提出了一种名为语义推理网络(semantic reasoning network, SRN)的新型端到端可训练框架,用于精确的场景文本识别,其中引入了全局语义推理模块(global semantic reasoning module, GSRM)以通过多路并行传输捕获全局语义上下文。在 7 个公开基准(包括规则文本、不规则文本和非拉丁长文本)上的 state-of-the-art(最优)结果验证了所提方法的有效性与鲁棒性。此外,SRN 的速度相比基于 RNN 的方法具有显著优势,展示了其实用价值。

关键词

引用

@article{arxiv.2003.12294,
  title  = {Towards Accurate Scene Text Recognition with Semantic Reasoning Networks},
  author = {Deli Yu and Xuan Li and Chengquan Zhang and Junyu Han and Jingtuo Liu and Errui Ding},
  journal= {arXiv preprint arXiv:2003.12294},
  year   = {2020}
}

备注

Accepted to CVPR2020