用于高性能词分类的有限规模同质 CNN/LSTM 集成
计算与语言
2021-02-03 v1 机器学习
摘要
近年来,长短期记忆神经网络(LSTMs)已相当成功地应用于手写文本识别问题。然而,其优势更多在于处理变长序列,而非处理图像模式的几何可变性。此外,LSTM 的最佳结果往往基于对大量网络实例集成的规模化训练。本文使用端到端卷积 LSTM 神经网络来同时处理几何变异与序列变异。我们表明,通过适当的编码方案与投票方案,仅用五个此类网络并配合恰当的数据增强,即可在通用基准集上达到高性能。这些网络具有相似架构(卷积神经网络(CNN):五层,双向 LSTM(BiLSTM):三层,后接连接主义时序分类(CTC)处理步骤)。该方法采用不同尺度的输入图像与不同的特征图大小。使用两个数据集评估算法性能:标准基准 RIMES 数据集(法语)与历史手写数据集 KdK(荷兰语)。RIMES 词识别测试的最终性能为 96.6%,明显优于其他 SOTA 方法。在 KdK 数据集上,我们的方法也展现出良好结果。所提方法已部署于 Monk 历史手写收藏搜索引擎中。
引用
@article{arxiv.1912.03223,
title = {A limited-size ensemble of homogeneous CNN/LSTMs for high-performance word classification},
author = {Mahya Ameryan and Lambert Schomaker},
journal= {arXiv preprint arXiv:1912.03223},
year = {2021}
}