中文

利用语言模型监督进行手写识别模型自适应

计算机视觉与模式识别 2018-08-07 v1

摘要

训练最先进的离线手写识别(HWR)模型需要大规模标注数据集,但由于人工标注成本高昂,并非所有语言与领域都具备此类数据集。我们通过展示如何利用高资源语言来帮助训练低资源语言模型来解决此问题。我们提出一种迁移学习方法,将源语言上训练的手写识别模型自适应到使用相同书写文字的目标语言。该方法仅需要源语言标注数据、目标语言未标注数据以及目标语言的语言模型。语言模型以自举方式用于精炼目标语言中的预测,以作为训练模型的真值。使用该方法,我们展示了利用历史与现代手写数据集在法语、英语和西班牙语之间的改进可迁移性。在最佳情况下,使用所提方法的迁移得到的字符错误率几乎与全监督训练一样好。

关键词

引用

@article{arxiv.1808.01423,
  title  = {Language Model Supervision for Handwriting Recognition Model Adaptation},
  author = {Chris Tensmeyer and Curtis Wigington and Brian Davis and Seth Stewart and Tony Martinez and William Barrett},
  journal= {arXiv preprint arXiv:1808.01423},
  year   = {2018}
}