DocTron-公式:复杂场景下的通用公式识别
计算机视觉与模式识别
2025-08-04 v1
摘要
数学公式光学字符识别(OCR)是智能分析科学文献的关键技术。然而,特定任务或通用视觉语言模型往往难以处理数学内容所固有的结构多样性、复杂性和现实可变性。在本工作中,我们提出DocTron-公式,一个基于通用视觉语言模型构建的统一框架,无需专用架构。此外,我们引入CSFormula数据集,涵盖多学科且结构复杂的公式,包含行、段和页三个层次。通过简单的监督微调,我们的方法在多种风格、科学领域和复杂布局上实现了最先进的性能。实验结果表明,我们的方法不仅在准确率和鲁棒性方面超越专用模型,还为自动理解复杂科学文档确立了新的范式。
引用
@article{arxiv.2508.00311,
title = {DocTron-Formula: Generalized Formula Recognition in Complex and Structured Scenarios},
author = {Yufeng Zhong and Zhixiong Zeng and Lei Chen and Longrong Yang and Liming Zheng and Jing Huang and Siqi Yang and Lin Ma},
journal= {arXiv preprint arXiv:2508.00311},
year = {2025}
}