MixTex:单眼识别不应仅依赖真实数据
计算机视觉与模式识别
2024-07-12 v2
摘要
本文介绍了 MixTex,这是一个用于低偏差多语言识别的端到端 LaTeX 光学字符识别模型,以及其新颖的数据收集方法。在将 Transformer 架构应用于 LaTeX 文本识别时,我们识别出了特定的偏差问题,例如频繁将 误interpret为 。我们将这种偏差归因于常用于训练的 arXiv 数据集的特征。为缓解这种偏差,我们提出了一种创新的数据增强方法。该方法通过将真实文本与伪文本混合,并纠入少量干扰字符,来引入受控噪声到识别目标中。我们进一步建议,这种方法对各种歧义识别任务都有更广泛的适用性,包括对音乐演出中错误笔记的准确识别。MixTex 的架构以 Swin Transformer 作为编码器,RoBERTa 作为解码器。我们的实验结果表明,这种方法显著降低了识别任务中的偏差。值得注意的是,在处理清晰且无歧义的图像时,模型严格遵循图像,而不是过度依赖上下文线索进行 token 预测。
引用
@article{arxiv.2406.17148,
title = {MixTex: Unambiguous Recognition Should Not Rely Solely on Real Data},
author = {Renqing Luo and Yuhan Xu},
journal= {arXiv preprint arXiv:2406.17148},
year = {2024}
}