中文

olmOCR:解锁 PDF 中的万亿级 token via 视觉语言模型

计算与语言 2025-07-03 v3

摘要

PDF 文档有望为训练语言模型提供万亿个新颖的高质量 token。然而,这些文档类型多样,格式和视觉布局不同,难以提取并忠实地表示其底层内容以供语言模型使用。传统开源工具往往产生的提取质量低于视觉语言模型(VLM),但依赖最佳 VLM 可能昂贵得不可行(例如,GPT-4o 每百万页 PDF 文档成本超过 6,240 美元),或在无法将 PDF 发送到专有 API 时不可行。我们提出 olmOCR,一个开源工具包,可将 PDF 处理为干净、线性化的纯文本,保持自然阅读顺序,同时保留诸如章节、表格、列表、方程等结构化内容。我们的工具包运行一个微调的 7B 视觉语言模型(VLM),其训练数据为 olmOCR-mix-0225,来自超过 100,000 个爬取 PDF 页面中 260,000 页的样本,涵盖多种属性,包括图形、手写文字和质量较差的扫描件。olmOCR 针对大规模批处理进行优化,能够灵活地适应不同的硬件配置,仅需 176 美元即可转换一百万页 PDF。为 aid 与现有系统比较,我们还引入 olmOCR-Bench,一个精选的 1,400 份 PDF 集合,捕捉了即便是最佳工具和 VLM 也难以应对的许多内容类型,包括公式、表格、小字体、旧扫描件等。我们发现 olmOCR 的表现甚至优于包括 GPT-4o、Gemini Flash 2 和 Qwen-2.5-VL 在内的顶级 VLM。我们公开释放 olmOCR 的所有组件:我们的微调 VLM 模型、训练代码和数据、支持 vLLM 和 SGLang 后端的高效推理管道,以及基准 olmOCR-Bench。

关键词

引用

@article{arxiv.2502.18443,
  title  = {olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models},
  author = {Jake Poznanski and Aman Rangapur and Jon Borchardt and Jason Dunkelberger and Regan Huff and Daniel Lin and Aman Rangapur and Christopher Wilhelm and Kyle Lo and Luca Soldaini},
  journal= {arXiv preprint arXiv:2502.18443},
  year   = {2025}
}