中文

复杂数学表达式识别:基准、大规模数据集与强基线

计算机视觉与模式识别 2025-12-17 v1 人工智能

摘要

数学表达式识别(MER)在简单表达式的识别上已取得显著进展,但对包含大量标记和多行的复杂数学表达式的鲁棒识别仍是一个严峻挑战。本文首先引入CMER-Bench,一个精心构建的基准,将表达式分为三个难度等级:简单、中等和复杂。利用CMER-Bench,我们对现有MER模型和通用多模态大语言模型(MLLM)进行了全面评估。结果表明,尽管现有方法在简单和中等表达式上表现良好,但在处理复杂数学表达式时性能显著下降,主要是因为现有公开训练数据集主要由简单样本组成。作为回应,我们提出了MER-17M和CMER-3M两个强调复杂数学表达式识别的大规模数据集。这些数据集提供了丰富多样的样本,以支持准确且鲁棒的复杂MER模型的开发。此外,为应对复杂表达式中复杂的空间布局问题,我们引入了一种新型表达式标记器,以及一种称为结构化数学语言(Structured Mathematical Language)的新表示方法,该方法在LaTeX格式之外显式建模表达式的层次和空间结构。基于这些工作,我们提出了一个名为CMERNet的专用模型,基于编码器-解码器架构并在CMER-3M上进行训练。实验结果表明,CMERNet仅含1.25亿参数,在CMER-Bench上显著优于现有MER模型和MLLM。

关键词

引用

@article{arxiv.2512.13731,
  title  = {Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline},
  author = {Weikang Bai and Yongkun Du and Yuchen Su and Yazhen Xie and Zhineng Chen},
  journal= {arXiv preprint arXiv:2512.13731},
  year   = {2025}
}