olmOCR 2:文档 OCR 的单元测试奖励
计算机视觉与模式识别
2025-10-23 v1 计算与语言
摘要
我们介绍 olmOCR 2,这是我们系列强大 OCR 系统的最新版本,用于将数字化印刷文档(如 PDF)转换为干净、自然排序的纯文本。olmOCR 2 由 olmOCR-2-7B-1025 提供动力,这是一个专用的 7B 视觉语言模型(VLM),通过可验证奖励的强化学习训练(RLVR),其中我们的奖励是多样化的二进制单元测试集合。为扩大单元测试的创建规模,我们开发了用于生成具有多样且具有挑战性布局的合成文档、已知的 HTML 源代码以及提取的测试用例的管道。我们展示了在这些测试用例上进行 RL 训练可实现 olmOCR-Bench 上最先进的性能,该基准为我们的英语语言 OCR 测试基准,最大的改进在于数学公式转换、表格解析和多列布局。我们在宽松开放许可下发布了该模型、数据和代码。
引用
@article{arxiv.2510.19817,
title = {olmOCR 2: Unit Test Rewards for Document OCR},
author = {Jake Poznanski and Luca Soldaini and Kyle Lo},
journal= {arXiv preprint arXiv:2510.19817},
year = {2025}
}
备注
https://olmocr.allen.ai/