中文

PP-FormulaNet:精准与效率的高级公式识别之桥

计算机视觉与模式识别 2025-03-25 v1 人工智能

摘要

公式识别是文档智能中的重要任务,涉及将数学表达式从文档图像转换为计算机易于处理的结构化符号格式。LaTeX 是此目的最常用的格式。本文提出 PP-FormulaNet,一款在准确率和效率方面均表现卓越的公式识别模型。为满足应用的多样化需求,我们开发了两个专用模型:PP-FormulaNet-L 专为高准确率场景设计,PP-FormulaNet-S 专为高效率场景优化。我们的广泛评估显示,PP-FormulaNet-L 的准确率显著超越 UniMERNet 等前沿模型,提升了约 6%。相比之下,PP-FormulaNet-S 的速度则快超过 16 倍。这些突破性进展促进了 PP-FormulaNet 无缝集成到涉及复杂数学公式的广泛文档处理环境中。此外,我们引入公式矿掘系统,能够从海量高质量公式数据中进行提取。该系统进一步增强了我们公式识别模型的鲁性与适用性。代码和模型已在 PaddleOCR(https://github.com/PaddlePaddle/PaddleOCR)和 PaddleX(https://github.com/PaddlePaddle/PaddleX)上公开。

关键词

引用

@article{arxiv.2503.18382,
  title  = {PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition},
  author = {Hongen Liu and Cheng Cui and Yuning Du and Yi Liu and Gang Pan},
  journal= {arXiv preprint arXiv:2503.18382},
  year   = {2025}
}