基于深度卷积神经网络的街景图像多位数字识别
计算机视觉与模式识别
2014-04-15 v4
摘要
在无约束的自然照片中识别任意多字符文本是一个难题。本文解决了该领域中一个同样困难的子问题,即从街景图像中识别任意多位数字。解决此问题的传统方法通常将定位、分割和识别步骤分离开来。在本文中,我们提出了一种统一的方法,通过使用直接作用于图像像素的深度卷积神经网络,将这三个步骤整合在一起。我们采用 DistBelief 实现的深度神经网络,以便在高质量图像上训练大型分布式神经网络。我们发现,该方法的性能随着卷积网络深度的增加而提高,最佳性能出现在我们训练的最深架构中,该架构包含十一层隐藏层。我们在公开可用的 SVHN 数据集上评估了该方法,在识别完整街道号码方面取得了超过 的准确率。我们表明,在逐位数字识别任务上,我们改进了现有技术,达到了 的准确率。我们还在一个更具挑战性的数据集上评估了该方法,该数据集由街景图像生成,包含数千万个街道号码标注,并取得了超过 的准确率。为了进一步探索所提出系统在更广泛文本识别任务中的适用性,我们将其应用于来自 reCAPTCHA 的合成失真文本。reCAPTCHA 是最安全的反向图灵测试之一,它利用失真文本区分人类与机器人。我们在 reCAPTCHA 最难类别上的准确率报告为 。我们在两项任务上的评估表明,在特定的操作阈值下,所提出系统的性能可与人类操作员相媲美,在某些情况下甚至超越人类操作员。
引用
@article{arxiv.1312.6082,
title = {Multi-digit Number Recognition from Street View Imagery using Deep Convolutional Neural Networks},
author = {Ian J. Goodfellow and Yaroslav Bulatov and Julian Ibarz and Sacha Arnoud and Vinay Shet},
journal= {arXiv preprint arXiv:1312.6082},
year = {2014}
}