GutenOCR:文档的面向 grounding 的视觉语言前端
计算机视觉与模式识别
2026-01-23 v2 人工智能
计算与语言
机器学习
摘要
GutenOCR是通过微调Qwen2.5-VL-3B和Qwen2.5-VL-7B获得的面向 grounding 的OCR前端。 resulting single-checkpoint vision-language models通过统一的、基于提示的接口暴露阅读、检测和 grounding 功能。模型在商业文件、科学文章和合成 grounding 数据上进行训练,支持全页和局部阅读,提供行级和段落级边界框以及条件“where is x?”查询。我们引入了面向 grounding 的OCR评估协议,表明GutenOCR-7B在10.5K个 held-out商业和科学页面上的综合 grounding OCR分数显著提升(从0.40提升至0.82)。在Fox和OmniDocBench v1.5上,我们的方法在区域级和行级OCR以及文本检测召回率方面均实现了显著改进,但揭示了在页面级线性化、颜色引导OCR以及公式密集型布局方面的权衡。
引用
@article{arxiv.2601.14490,
title = {GutenOCR: A Grounded Vision-Language Front-End for Documents},
author = {Hunter Heidenreich and Ben Elliott and Olivia Dinica and Yosheb Getachew},
journal= {arXiv preprint arXiv:2601.14490},
year = {2026}
}