中文

基于伪标签的半监督手写数学表达式识别

计算机视觉与模式识别 2025-02-21 v3 人工智能

摘要

本文研究了通过探索有标签数据和额外无标签数据的半监督手写数学表达式识别 (HMER) 方法。我们提出一种新的一致性正则化框架,称为SemiHMER,它引入双分支半监督学习。具体而言,我们强制两个网络对同一输入图像进行一致预测。通过标准交叉熵损失,利用一个扰动后的识别网络生成的伪标签来监督另一个网络。SemiHMER的一致性鼓励同一输入图像的两个扰动网络预测之间的高度相似性,并通过利用带伪标签的无标签数据来扩充训练数据。我们进一步提出一种弱到强策略,对每个分支应用不同的增强程度,有效扩充训练数据并提高网络训练质量。此外,我们提出了一种新模块——全局动态计数模块 (GDCM),以增强HMER解码器的性能,缓解长距离公式识别中的识别不准确问题,减少重复字符的发生。实验结果表明,我们的工作在CROHME14、CROHME16和CROHME19上的平均准确率分别提高了5.47%、4.87%和5.25%。

关键词

引用

@article{arxiv.2502.07172,
  title  = {SemiHMER: Semi-supervised Handwritten Mathematical Expression Recognition using pseudo-labels},
  author = {Kehua Chen and Haoyang Shen},
  journal= {arXiv preprint arXiv:2502.07172},
  year   = {2025}
}

备注

17 pages,3 figures