基于注意力机制从街景图像中提取结构化信息
计算机视觉与模式识别
2017-08-22 v4
摘要
我们提出了一个神经网络模型——基于 CNN、RNN 和一种新颖的注意力机制——该模型在具有挑战性的 French Street Name Signs (FSNS) 数据集上达到了 84.2% 的准确率,显著优于先前的最优方法 (Smith'16)(其准确率为 72.46%)。此外,我们的新方法比先前方法更简单且更具通用性。为展示模型的通用性,我们表明它在一个源自 Google Street View 的更具挑战性的数据集上同样表现良好,该数据集的目标是从店面提取商户名称。最后,我们研究了使用不同深度的 CNN 特征提取器所带来的速度/准确率权衡。令人惊讶的是,我们发现更深并不总是更好(无论在准确率还是速度方面)。我们最终的模型简单、准确且快速,使其能够在大规模下应用于各种具有挑战性的真实世界文本提取问题。
引用
@article{arxiv.1704.03549,
title = {Attention-based Extraction of Structured Information from Street View Imagery},
author = {Zbigniew Wojna and Alex Gorban and Dar-Shyang Lee and Kevin Murphy and Qian Yu and Yeqing Li and Julian Ibarz},
journal= {arXiv preprint arXiv:1704.03549},
year = {2017}
}
备注
Updated references, added link to the source code