一种混合式Vision Transformer用于数学表达式识别
计算机视觉与模式识别
2026-03-10 v1
摘要
文档分析中的数学表达式识别是一个关键挑战。与仅关注一维结构图像的文本识别不同,数学表达式识别是一个更复杂的问题,因为其二维结构和不同符号大小。在本文中,我们提出使用具有2D位置编码的混合式Vision Transformer (HVT)作为编码器来提取图像中符号之间的复杂关系。使用覆盖注意力解码器以更好地跟踪注意力历史,以处理欠解析和过度解析问题。我们还展示了将ViT的[CLS] token作为解码器初始嵌入的优势。在在IM2LATEX-100K数据集上的实验表明,我们的方法通过实现BLEU分数89.94而优于当前最先进的方法。
引用
@article{arxiv.2603.07929,
title = {A Hybrid Vision Transformer Approach for Mathematical Expression Recognition},
author = {Anh Duy Le and Van Linh Pham and Vinh Loi Ly and Nam Quan Nguyen and Huu Thang Nguyen and Tuan Anh Tran},
journal= {arXiv preprint arXiv:2603.07929},
year = {2026}
}
备注
Accepted as oral presentation at DICTA 2022