OCRVerse:面向端到端视觉语言模型的全方位OCR
计算机视觉与模式识别
2026-02-05 v2
摘要
大型视觉语言模型的发展推动了管理和应用大量多模态数据的需求,使得从视觉图像中提取信息的OCR技术日益受到欢迎。然而,现有OCR方法主要关注从图像或扫描文档中识别文本元素(文本导向OCR),忽略了从视觉信息密集型图像源中识别视觉元素的需求(视觉导向OCR),如图表、网页和科学图。事实上,这些视觉信息密集型图像在互联网上广泛存在,并具有重要的实际应用价值,如数据可视化和网页分析。本技术报告中,我们提出了OCRVerse,即首个以端到端方式实现文本导向OCR和视觉导向OCR统一的全方位OCR方法。为此,我们构建了全面的数据工程,覆盖广泛的文本导向文档,如报纸、杂志和书籍,以及视觉导向渲染复合物,包括图表、网页和科学图。此外,我们提出了一种两种阶段的SFT-RL多域训练方法用于OCRVerse。SFT直接混合跨域数据进行训练并建立初始域知识,而RL侧重于为每个域的特征设计个人化奖励策略。具体而言,由于不同域需要不同的输出格式和预期输出,我们在RL阶段提供了足够的灵活性,为每个域自定义灵活的奖励信号,从而提高跨域融合并避免数据冲突。实验结果表明,OCRVerse有效且在文本导向和视觉导向数据类型上均取得竞争成绩,甚至与大规模开源和闭源模型相当。
引用
@article{arxiv.2601.21639,
title = {OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models},
author = {Yufeng Zhong and Lei Chen and Xuanle Zhao and Wenkang Han and Liming Zheng and Jing Huang and Deyang Jiang and Yilin Cao and Lin Ma and Zhixiong Zeng},
journal= {arXiv preprint arXiv:2601.21639},
year = {2026}
}