基于更精细网格校正的场景文本识别
计算机视觉与模式识别
2020-01-28 v1
摘要
由于不规则的字体风格和多种畸变,场景文本识别是一个具有挑战性的问题。本文提出了一种端到端可训练的模型,由一个更精细的校正模块和一个双向注意力识别网络(Firbarn)组成。校正模块采用更精细的网格来校正畸变的输入图像,双向解码器仅包含一层解码层而非两个分离的解码层。Firbarn 可以以弱监督的方式训练,仅需场景文本图像及对应的单词标签。凭借灵活的校正和新颖的双向解码器,在标准基准上的大量评估结果表明 Firbarn 优于以往的工作,尤其是在不规则数据集上。
引用
@article{arxiv.2001.09389,
title = {Scene Text Recognition With Finer Grid Rectification},
author = {Gang Wang},
journal= {arXiv preprint arXiv:2001.09389},
year = {2020}
}
备注
6pages,3 figures