2D-LSTM 对于离线文本识别真的过时了吗?
计算机视觉与模式识别
2018-11-28 v1
摘要
在基于深度神经网络的手写文本识别中,近期有一种趋势是用 1D 循环层取代 2D 循环层,在某些情况下甚至完全移除循环层,仅依赖简单的前馈卷积架构。最常用的循环层类型是长短期记忆(Long-Short Term Memory, LSTM)。这样做的动机有很多:2D-LSTM 的开源实现很少,支持 GPU 的实现更少(目前 cuDNN 仅实现了 1D-LSTM);2D 循环减少了可并行化的计算量,从而可能增加训练/推理时间;循环会对输入产生全局依赖,有时这可能并不可取。许多近期竞赛的获胜系统都采用了使用 2D-LSTM 层的网络。大多数先前将 1D 或纯前馈架构与 2D 循环模型进行比较的工作,要么在简单数据集上进行,要么未充分优化与挑战者模型(后者经过了精心优化)相比的“基线”2D 模型。在本文中,我们旨在对 2D 模型与竞争模型进行公平比较,并在比复杂性受限的“学术”数据集更能代表具有挑战性的“真实世界”数据的更复杂数据集上对其进行广泛评估。我们旨在确定 1D 和 2D 循环模型何时以及为何产生不同结果。我们还将结果与语言模型进行比较,以评估语言约束是否拉平了不同网络的性能。我们的结果表明,对于具有挑战性的数据集,2D-LSTM 网络似乎仍提供最高性能,并我们提出了一种可视化策略来解释这一现象。
引用
@article{arxiv.1811.10899,
title = {Are 2D-LSTM really dead for offline text recognition?},
author = {Bastien Moysset and Ronaldo Messina},
journal= {arXiv preprint arXiv:1811.10899},
year = {2018}
}
备注
12 pages, 4 figures