中文

LightOnOCR:面向SOTA的1B参数端到端多语言视觉语言模型

计算机视觉与模式识别 2026-01-21 v1

摘要

我们present了LightOnOCR-2-1B,一个10亿参数的端到端多语言视觉-语言模型,将文档图像(例如PDF)转换为干净、自然排序的文本,而无需脆弱的OCR流水线。该模型在大规模高质量蒸馏混合数据上训练,涵盖扫描件、法国文件和科学PDF,LightOnOCR-2在OlmOCR-Bench上实现了最先进的结果,同时比以前最好的模型小9倍且显著更快。我们进一步扩展输出格式以预测嵌入图像的归一化边界框,通过采用恢复策略进行预训练中的局部化,并通过基于IoU的奖励进行RLVR进行细化。最后,我们通过检查点平均和任务算术合并来提高鲁棒性。我们在Apache 2.0许可下发布模型检查点,并在各自许可下公开数据集和LightOnOCR-bbox-bench评估基准。

关键词

引用

@article{arxiv.2601.14251,
  title  = {LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR},
  author = {Said Taghadouini and Adrien Cavaillès and Baptiste Aubertin},
  journal= {arXiv preprint arXiv:2601.14251},
  year   = {2026}
}