MMHMER:面向手写数学表达式识别的多视角、多任务方法
计算机视觉与模式识别
2025-08-21 v3
摘要
手写数学表达式识别(HMER)方法取得了显著进展,现有的大多数HMER方法基于基于CNN/RNN的GRU架构或Transformer架构。每种方法都有其优势和不足。将不同模型结构作为视角充分利用其多样化能力,并有效整合其能力,具有引人入胜的探索方向。这涉及两个关键挑战:1)如何有效融合这两种方法,2)如何在合适的复杂度水平下实现更高的性能。本文提出一种高效的CNN-Transformer多视角、多任务方法,以增强模型的识别性能。我们的MMHMER模型在CROHME14、CROHME16和CROHME19上分别实现了63.96%、62.51%和65.46%的ExpRate,相较于Posformer分别提升了1.28%、1.48%和0.58%。本文方法的主要贡献在于,我们提出了一种新的多视角、多任务框架,能够有效整合CNN和Transformer的优势。通过利用CNN的特征提取能力和Transformer的序列建模能力,我们的模型能够更好地处理手写数学表达式的复杂性。
关键词
引用
@article{arxiv.2502.05557,
title = {MMHMER:Multi-viewer and Multi-task for Handwritten Mathematical Expression Recognition},
author = {Kehua Chen and Haoyang Shen and Lifan Zhong and Mingyi Chen},
journal= {arXiv preprint arXiv:2502.05557},
year = {2025}
}
备注
7 pages;2 figures