中文

手写文本识别中序列到序列模型的评估

计算机视觉与模式识别 2019-07-16 v2 机器学习

摘要

编码器-解码器模型已成为机器翻译、图像描述与语音识别等序列学习任务的有效方法,但在手写文本识别上尚未展现出有竞争力的结果。为此,我们提出一种基于注意力的序列到序列模型。它结合卷积神经网络作为通用特征提取器与循环神经网络,以编码输入图像中字符的视觉信息及时间上下文,并使用独立的循环神经网络解码实际字符序列。我们在多种注意力机制与位置编码间进行实验比较,以寻找输入与输出序列间的合适对齐。该模型可端到端训练,且混合损失的可选集成使编码器在需要时保留可解释且可用的输出。在不使用语言模型的情况下,我们在 IAM 与 ICFHR2016 READ 数据集上取得了与最优方法相当的竞争结果,并显著优于任何近期的序列到序列方法。

关键词

引用

@article{arxiv.1903.07377,
  title  = {Evaluating Sequence-to-Sequence Models for Handwritten Text Recognition},
  author = {Johannes Michael and Roger Labahn and Tobias Grüning and Jochen Zöllner},
  journal= {arXiv preprint arXiv:1903.07377},
  year   = {2019}
}

备注

8 pages, 1 figure, 8 tables