中文

一种混合式Vision Transformer用于数学表达式识别

计算机视觉与模式识别 2026-03-10 v1

摘要

文档分析中的数学表达式识别是一个关键挑战。与仅关注一维结构图像的文本识别不同,数学表达式识别是一个更复杂的问题,因为其二维结构和不同符号大小。在本文中,我们提出使用具有2D位置编码的混合式Vision Transformer (HVT)作为编码器来提取图像中符号之间的复杂关系。使用覆盖注意力解码器以更好地跟踪注意力历史,以处理欠解析和过度解析问题。我们还展示了将ViT的[CLS] token作为解码器初始嵌入的优势。在在IM2LATEX-100K数据集上的实验表明,我们的方法通过实现BLEU分数89.94而优于当前最先进的方法。

关键词

引用

@article{arxiv.2603.07929,
  title  = {A Hybrid Vision Transformer Approach for Mathematical Expression Recognition},
  author = {Anh Duy Le and Van Linh Pham and Vinh Loi Ly and Nam Quan Nguyen and Huu Thang Nguyen and Tuan Anh Tran},
  journal= {arXiv preprint arXiv:2603.07929},
  year   = {2026}
}

备注

Accepted as oral presentation at DICTA 2022