中文

双向训练的树结构解码器用于手写数学表达式识别

计算机视觉与模式识别 2024-01-02 v1 人工智能

摘要

手写数学表达式识别(HMER)任务是OCR领域的一个重要分支。最近的研究表明,引入双向上下文信息显著提高了HMER模型的性能。然而,现有方法在推理阶段未能有效利用双向上下文信息。此外,当前的双向训练方法主要针对字符串解码器设计,不能很好地推广到具有更优泛化能力和结构分析能力的树解码器。为了克服这些限制,我们提出了镜像翻转符号布局树(MF-SLT)和双向异步训练(BAT)结构。我们的方法将双向训练策略扩展到树解码器,通过利用双向信息实现更有效的训练。此外,我们分别分析了HMER模型的视觉和语言感知的影响,并引入了共享语言建模(SLM)机制。通过SLM,我们增强了模型在处理视觉模糊性时的鲁棒性和泛化能力,特别是在训练数据充足的情况下。我们的方法通过大量实验得到验证,证明其在CROHME 2014、2016和2019数据集以及HME100K数据集上取得了新的最先进结果。实验中使用的代码将公开。

关键词

引用

@article{arxiv.2401.00435,
  title  = {Bidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression Recognition},
  author = {Hanbo Cheng and Chenyu Liu and Pengfei Hu and Zhenrong Zhang and Jiefeng Ma and Jun Du},
  journal= {arXiv preprint arXiv:2401.00435},
  year   = {2024}
}