FireRed-OCR 技术报告
计算机视觉与模式识别
2026-03-03 v1 图像与视频处理
摘要
我们 presented FireRed-OCR,一个系统化的框架,用于将通用视觉语言模型 (VLM) 专门化为高性能 OCR 模型。大型视觉语言模型 (VLMs) 已展示出惊人的通用能力,但在处理复杂文档时经常出现“结构幻觉”,限制了其在工业 OCR 应用中的实用性。本文引入 FireRed-OCR,一种新型框架,旨在将基于 Qwen3-VL 的通用 VLMs 转化为像素级精确的结构化文档解析专家。为解决高质量结构化数据稀缺的問題,我们构建了一个“几何 + 语义”数据工厂。不同于传统随机抽样,我们的管道利用几何特征聚类和多维标记来合成和筛选高度平衡的数据集,有效处理长尾布局和罕见文档类型。此外,我们提出了三阶段渐进式训练策略,引导模型从像素级感知到逻辑结构生成:(1)多任务预对齐以奠定文档结构理解基础;(2)专业 SFT 以标准化全图像 Markdown 输出;(3)格式受限的分组相对策略优化 (GRPO),其利用强化学习来确保严格的语法有效性和结构完整性(如表格闭合、公式语法)。在 OmniDocBench v1.5上的广泛评估表明,FireRed-OCR 实现了以 92.94% 总体得分实现的领先性能,显著优于 DeepSeek-OCR 2 和 OCRVerse 等强大基线,涵盖文本、公式、表格和阅读顺序等指标。我们开源代码和模型权重,以促进“通用 VLM 向专业结构专家”范式的实现。
引用
@article{arxiv.2603.01840,
title = {FireRed-OCR Technical Report},
author = {Hao Wu and Haoran Lou and Xinyue Li and Zuodong Zhong and Zhaojun Sun and Phellon Chen and Xuanhe Zhou and Kai Zuo and Yibo Chen and Xu Tang and Yao Hu and Boxiang Zhou and Jian Wu and Yongji Wu and Wenxin Yu and Yingmiao Liu and Yuhao Huang and Manjie Xu and Gang Liu and Yidong Ma and Zhichao Sun and Changhao Qiao},
journal= {arXiv preprint arXiv:2603.01840},
year = {2026}
}