中文

ConvMath:一种用于数学表达式识别的卷积序列网络

计算机视觉与模式识别 2020-12-24 v1

摘要

尽管光学字符识别(OCR)近期取得进展,数学表达式因其二维图形布局仍面临巨大的识别挑战。本文提出一种卷积序列建模网络 ConvMath,以端到端方式将图像中的数学表达式描述转换为 LaTeX 序列。该网络结合用于特征提取的图像编码器与用于序列生成的卷积解码器。相较于其他基于长短期记忆(LSTM)的编码器-解码器模型,ConvMath 完全基于卷积,因此易于进行并行计算。此外,网络在解码器中采用多层注意力机制,使模型能自动将输出符号与源特征向量对齐,并缓解训练模型时缺乏覆盖的问题。ConvMath 在一个名为 IM2LATEX-100K 的开放数据集(含 103556 个样本)上评估。实验结果表明,所提网络达到了最先进的准确率,且效率远优于先前方法。

关键词

引用

@article{arxiv.2012.12619,
  title  = {ConvMath: A Convolutional Sequence Network for Mathematical Expression Recognition},
  author = {Zuoyu Yan and Xiaode Zhang and Liangcai Gao and Ke Yuan and Zhi Tang},
  journal= {arXiv preprint arXiv:2012.12619},
  year   = {2020}
}

备注

Accepted in ICPR2020