数学公式的文本描述生成
计算机视觉与模式识别
2020-08-10 v1
摘要
由于数学符号与表达式的高度可变性,文档图像中数学表达或公式的读取极具挑战性。在本文中,我们将数学公式的读取视为一项生成文本描述的任务,该文本描述解释此公式的内在含义。受计算机视觉中自然图像描述问题的启发,我们提出了一种数学公式描述(MED)模型,这是一种新颖的端到端可训练深度神经网络方法,能够学习为数学公式图像生成文本描述以进行读取。我们的MED模型由一个作为编码器的卷积神经网络(提取输入数学公式图像的特征)和一个带注意力机制的循环神经网络(生成与输入数学公式图像相关的描述)组成。由于缺少带有文本描述的数学公式图像数据集,我们生成了两个用于实验目的的数据集。为验证MED模型的有效性,我们进行了一项真实实验,以观察学生能否仅通过阅读或聆听文本描述来写出公式。实验表明,学生仅通过阅读文本描述就能正确写出大部分公式。
引用
@article{arxiv.2008.02980,
title = {Textual Description for Mathematical Equations},
author = {Ajoy Mondal and C. V. Jawahar},
journal= {arXiv preprint arXiv:2008.02980},
year = {2020}
}
备注
8