中文

UniRec-0.1B:用于统一文本和公式识别的 0.1B 参数模型

计算机视觉与模式识别 2026-01-06 v1

摘要

文本和公式构成许多文档的核心信息组成部分。准确且高效地识别两者对于开发稳健和通用的文档解析系统至关重要。最近,视觉语言模型 (VLM) 在统一识别文本和公式方面取得了显著的成就。然而,这些模型参数庞大且计算密集,限制了其在许多应用中的使用。本文提出 UniRec-0.1B,一个仅需 0.1B 参数的统一识别模型,能够在字符、单词、行、段落和文档等多个层次上执行文本和公式识别。为实现此任务,我们首先构建 UniRec40M,一个包含 4000 万 文本、公式及其混合样本的大规模数据集,支持训练强大而轻量级的模型。其次,我们确定构建此轻量级但统一的专家模型的两个挑战:它们是不同层次结构之间的变量性以及文本内容与公式内容之间的语义耦合。为解决这些问题,我们引入了分层监督训练,以显式引导结构理解,并提出了语义解耦 tokenizer,通过分离文本和公式表示来实现此目标。最后,我们开发了全面的评估基准,覆盖来自多个领域的中英文文档且层次多样。在该基准以及公开基准上的实验结果表明,UniRec-0.1B 不仅优于通用 VLM 和领先的文档解析专家模型,还实现了 2-9 倍的加速,验证了其有效性和效率。代码库和数据集:https://github.com/Topdu/OpenOCR。

关键词

引用

@article{arxiv.2512.21095,
  title  = {UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters},
  author = {Yongkun Du and Zhineng Chen and Yazhen Xie and Weikang Bai and Hao Feng and Wei Shi and Yuchen Su and Can Huang and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2512.21095},
  year   = {2026}
}