中文

基于更精细网格校正的场景文本识别

计算机视觉与模式识别 2020-01-28 v1

摘要

由于不规则的字体风格和多种畸变,场景文本识别是一个具有挑战性的问题。本文提出了一种端到端可训练的模型,由一个更精细的校正模块和一个双向注意力识别网络(Firbarn)组成。校正模块采用更精细的网格来校正畸变的输入图像,双向解码器仅包含一层解码层而非两个分离的解码层。Firbarn 可以以弱监督的方式训练,仅需场景文本图像及对应的单词标签。凭借灵活的校正和新颖的双向解码器,在标准基准上的大量评估结果表明 Firbarn 优于以往的工作,尤其是在不规则数据集上。

关键词

引用

@article{arxiv.2001.09389,
  title  = {Scene Text Recognition With Finer Grid Rectification},
  author = {Gang Wang},
  journal= {arXiv preprint arXiv:2001.09389},
  year   = {2020}
}

备注

6pages,3 figures