LightOnOCR:面向SOTA的1B参数端到端多语言视觉语言模型
计算机视觉与模式识别
2026-01-21 v1
摘要
我们present了LightOnOCR-2-1B,一个10亿参数的端到端多语言视觉-语言模型,将文档图像(例如PDF)转换为干净、自然排序的文本,而无需脆弱的OCR流水线。该模型在大规模高质量蒸馏混合数据上训练,涵盖扫描件、法国文件和科学PDF,LightOnOCR-2在OlmOCR-Bench上实现了最先进的结果,同时比以前最好的模型小9倍且显著更快。我们进一步扩展输出格式以预测嵌入图像的归一化边界框,通过采用恢复策略进行预训练中的局部化,并通过基于IoU的奖励进行RLVR进行细化。最后,我们通过检查点平均和任务算术合并来提高鲁棒性。我们在Apache 2.0许可下发布模型检查点,并在各自许可下公开数据集和LightOnOCR-bbox-bench评估基准。
关键词
引用
@article{arxiv.2601.14251,
title = {LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR},
author = {Said Taghadouini and Adrien Cavaillès and Baptiste Aubertin},
journal= {arXiv preprint arXiv:2601.14251},
year = {2026}
}