中文

当 OCR 效果良好仍不足以应对:面向工业级检索增强生成的 OCR 鲁棒性基准测试

计算机视觉与模式识别 2026-05-05 v1

摘要

工业级检索增强生成(RAG)系统依赖光学字符识别(OCR)将视觉文档转换为文本。现有 OCR 基准测试依赖字符级指标,无法在现实条件下充分衡量下游 RAG 的效果。我们引入一个面向工业级 RAG 系统的 OCR 基准测试,覆盖 11 种具有挑战性的文档类型,包括极端布局、高分辨率页面、复杂或带水印的背景、阅读顺序非标准的历史文献、视觉装饰文本以及包含表格和数学公式的文档。评估最新 SOTA OCR 模型在受控 OCR-优先 RAG 流程下表现,显示在真实工业文档上性能显著下降,尽管常规基准得分良好。我们发现,高 OCR 准确率并不一定转化为强劲的下游 RAG 性能:结构和语义错误即使在 WER/CER 保持较低时,也可导致显著的检索失败。进一步分析表明,这种不匹配随类别而异,通过检索侧和下游生成侧的双重失效得以引发,且在代表性的 OCR-优先管道选择中保持稳定。该基准测试已公开于 https://github.com/Qihoo360/InduOCRBench。

关键词

引用

@article{arxiv.2605.00911,
  title  = {When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation},
  author = {Lin Sun and Wang Dexian and Jingang Huang and Linglin Zhang and Change Jia and Zhengwei Cheng and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2605.00911},
  year   = {2026}
}