基于由粗到细注意力的图像到标记生成
计算机视觉与模式识别
2017-06-15 v2 计算与语言
机器学习
神经与进化计算
摘要
我们提出了一种神经编码器-解码器模型,基于可扩展的由粗到细注意力机制将图像转换为表示标记。我们的方法在图像到LaTeX生成的背景下进行评估,并引入了一个由真实渲染数学表达式与LaTeX标记配对组成的新数据集。我们表明,与使用基于CTC模型的神经OCR技术不同,基于注意力的方法可以处理这种非标准OCR任务。我们的方法在领域内渲染数据上大幅优于经典数学OCR系统,并且通过预训练,在领域外手写数据上也表现良好。为了降低基于注意力的方法相关的推理复杂度,我们引入了一种新的由粗到细注意力层,该层在应用注意力之前选择一个支撑区域。
引用
@article{arxiv.1609.04938,
title = {Image-to-Markup Generation with Coarse-to-Fine Attention},
author = {Yuntian Deng and Anssi Kanervisto and Jeffrey Ling and Alexander M. Rush},
journal= {arXiv preprint arXiv:1609.04938},
year = {2017}
}
备注
Accepted by ICML 2017