中文

请勿填充:高效的神经手写识别

计算机视觉与模式识别 2020-04-03 v1 机器学习 神经与进化计算

摘要

神经手写识别(NHR)是利用深度学习模型(如多维长短期记忆(MDLSTM)循环神经网络)对手写文本进行识别。带有 MDLSTM 层的模型在手写文本识别任务上取得了最先进的结果。虽然多方向 MDLSTM 层具有无与伦比的捕获各方向完整上下文的能力,这一优势限制了并行化的可能,因此带来高昂的计算成本。在本工作中,我们开发用于构建高效基于 MDLSTM 的 NHR 模型的方法,尤其是一种旨在消除由填充导致的计算浪费的方法。该提出的方法称为样本打包(example-packing),以二维网格中的高效平铺取代浪费的填充样本堆叠。对于基于词的 NHR,这相较于已对每个批次单独最小填充的高效基线带来了 6.6 倍的加速。对于基于行的 NHR,节省较为有限但仍显著。除样本打包外,我们提出:1)一种为包括 PyTorch 在内的动态图定义框架优化并行化的技术,使用分组卷积;2)一种跨 GPU 对变长样本批次进行并行化的方法。我们所有技术均在自行 PyTorch 复现的基于 MDLSTM 的 NHR 模型上进行了充分测试。在 IAM 数据集上的详尽评估表明,我们的模型性能与早期最先进模型的实现相近。我们高效的 NHR 模型及其中讨论的部分可复用技术,为深度学习中普遍存在的变长输入场景提供了实现相对高效模型的途径。

关键词

引用

@article{arxiv.1902.11208,
  title  = {No Padding Please: Efficient Neural Handwriting Recognition},
  author = {Gideon Maillette de Buy Wenniger and Lambert Schomaker and Andy Way},
  journal= {arXiv preprint arXiv:1902.11208},
  year   = {2020}
}