TexOCR: 面向可编译页面到 LaTeX 重建的数据文档 OCR 模型
计算与语言
2026-04-28 v1
摘要
现有文档 OCR 主要针对纯文本或 Markdown,忽略了使 LaTeX 成为科学出版物必不可少的结构性和可执行性。我们研究了将科学 PDF 进行页面级重建为可编译 LaTeX 的任务,引入 TexOCR-Bench 基准测试与 TexOCR-Train 大规模训练语料库。TexOCR-Bench 具备多维评估套件,联合评估转录忠实度、结构忠实度及端到端可编译性。基于 TexOCR-Train,我们训练了一个 20 亿参数模型 TexOCR,使用监督微调 (SFT) 和强化学习 (RL) 技术,采用由 LaTeX 单元测试直接 enforcing 可编译性和参照完整性的可验证奖励。跨 21 个前沿模型在 TexOCR-Bench 上的实验表明,现有系统频繁违反关键文档不变量,包括一致的章节结构、正确的浮动体放置及有效的标签-引用链接,这削弱了编译可靠性和下游可用性。我们的分析进一步表明,采用可验证奖励的 RL 在结构和编译指标上 consistently 优于 SFT alone。
引用
@article{arxiv.2604.22880,
title = {TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction},
author = {Chengye Wang and Lin Fu and Zexi Kuang and Yilun Zhao},
journal= {arXiv preprint arXiv:2604.22880},
year = {2026}
}
备注
Accepted by ACL 2026 Main