中文

MixTex:单眼识别不应仅依赖真实数据

计算机视觉与模式识别 2024-07-12 v2

摘要

本文介绍了 MixTex,这是一个用于低偏差多语言识别的端到端 LaTeX 光学字符识别模型,以及其新颖的数据收集方法。在将 Transformer 架构应用于 LaTeX 文本识别时,我们识别出了特定的偏差问题,例如频繁将 ete-t 误interpret为 ete^{-t}。我们将这种偏差归因于常用于训练的 arXiv 数据集的特征。为缓解这种偏差,我们提出了一种创新的数据增强方法。该方法通过将真实文本与伪文本混合,并纠入少量干扰字符,来引入受控噪声到识别目标中。我们进一步建议,这种方法对各种歧义识别任务都有更广泛的适用性,包括对音乐演出中错误笔记的准确识别。MixTex 的架构以 Swin Transformer 作为编码器,RoBERTa 作为解码器。我们的实验结果表明,这种方法显著降低了识别任务中的偏差。值得注意的是,在处理清晰且无歧义的图像时,模型严格遵循图像,而不是过度依赖上下文线索进行 token 预测。

关键词

引用

@article{arxiv.2406.17148,
  title  = {MixTex: Unambiguous Recognition Should Not Rely Solely on Real Data},
  author = {Renqing Luo and Yuhan Xu},
  journal= {arXiv preprint arXiv:2406.17148},
  year   = {2024}
}