用于自然场景文本识别的合成数据与人工神经网络
计算机视觉与模式识别
2014-12-10 v4
摘要
本文提出了一种自然场景文本识别框架。该框架无需任何人工标注数据,并对整幅图像进行整体词级识别,区别于以往基于字符的识别系统。该框架核心的深度神经网络模型完全在合成文本生成引擎产生的数据上进行训练——这些合成数据高度逼真且足以替代真实数据,从而提供了无限的训练数据。这种数据过剩为词识别模型带来了新的可能性,本文探讨了三种模型,它们分别通过 90k 路字典编码、字符序列编码和 N-gram 词袋编码以不同方式“阅读”单词。在基于语言的文本识别和完全无约束文本识别场景中,利用我们快速、简单的机制且无需任何数据采集成本,我们在标准数据集上的性能大幅超越了最先进水平(state-of-the-art)。
引用
@article{arxiv.1406.2227,
title = {Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition},
author = {Max Jaderberg and Karen Simonyan and Andrea Vedaldi and Andrew Zisserman},
journal= {arXiv preprint arXiv:1406.2227},
year = {2014}
}