中文

阅读还是推理?文档 OCR 的格式解耦强化学习

计算机视觉与模式识别 2026-01-15 v1 人工智能 计算与语言

摘要

通过 OCR 模型从图像或扫描文档中读取文本是研究者长期关注的焦点。直观地看,文本阅读被视为一个简单的感知任务,现有工作主要致力于构建丰富的数据工程以增强 SFT 能力。本文发现,尽管已有 OCR 模型在格式化文本(如公式、表格等)上的输出熵显著高于纯文本,往往高出一个数量级,这些统计模式揭示了先进的 OCR 模型在处理格式敏感文档时存在显著的输出不确定性,表明对多样化阅读路径进行推理可能改善 OCR 性能。为此,我们提出格式解耦强化学习 (FD-RL),利用高熵模式进行针对性优化。我们的 метод采用基于熵的数据过滤策略识别格式密集型实例,并针对不同格式类型设计格式解耦奖励,实现对格式层面的验证而非标记级别的记忆。FD-RL 在 OmniDocBench 上实现 90.41 的平均得分,创下该高热门基准上 end-to-end 模型的新纪录。更重要的是,我们对数据、训练、过滤和奖励策略进行了全面的消融研究,充分验证了其有效性。

关键词

引用

@article{arxiv.2601.08834,
  title  = {Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR},
  author = {Yufeng Zhong and Lei Chen and Zhixiong Zeng and Xuanle Zhao and Deyang Jiang and Liming Zheng and Jing Huang and Haibo Qiu and Peng Shi and Siqi Yang and Lin Ma},
  journal= {arXiv preprint arXiv:2601.08834},
  year   = {2026}
}

备注

technical report