中文

基于由粗到细注意力的图像到标记生成

计算机视觉与模式识别 2017-06-15 v2 计算与语言 机器学习 神经与进化计算

摘要

我们提出了一种神经编码器-解码器模型,基于可扩展的由粗到细注意力机制将图像转换为表示标记。我们的方法在图像到LaTeX生成的背景下进行评估,并引入了一个由真实渲染数学表达式与LaTeX标记配对组成的新数据集。我们表明,与使用基于CTC模型的神经OCR技术不同,基于注意力的方法可以处理这种非标准OCR任务。我们的方法在领域内渲染数据上大幅优于经典数学OCR系统,并且通过预训练,在领域外手写数据上也表现良好。为了降低基于注意力的方法相关的推理复杂度,我们引入了一种新的由粗到细注意力层,该层在应用注意力之前选择一个支撑区域。

关键词

引用

@article{arxiv.1609.04938,
  title  = {Image-to-Markup Generation with Coarse-to-Fine Attention},
  author = {Yuntian Deng and Anssi Kanervisto and Jeffrey Ling and Alexander M. Rush},
  journal= {arXiv preprint arXiv:1609.04938},
  year   = {2017}
}

备注

Accepted by ICML 2017