中文

OCR翻译失误?基于视觉的方法实现稳健文档检索

计算机视觉与模式识别 2025-05-12 v1 人工智能

摘要

检索增强生成 (RAG) 已成为通过在外部文档中对响应进行 grounding 来增强大型语言模型 (LLM) 可靠性和实用性的流行技术。传统RAG系统依赖光学字符识别 (OCR) 首先将扫描文档处理为文本。然而,即便是最先进的OCR也会在退化或复杂文档中引入错误。最近的视觉语言方法,如ColPali,提出直接对文档进行视觉嵌入,无需OCR。本研究对比了基于视觉的RAG系统 (ColPali) 与更传统的OCR依赖管道(使用Llama 3.2 (90B)和Nougat OCR),在不同文档质量下进行了系统比较。除了常规检索准确性指标外,我们还引入了语义答案评估基准,用于评估端到端问答性能。我们的发现表明,尽管视觉RAG在其训练所针对的文档上表现良好,但OCR依赖的RAG能够更好地泛化到质量各异且未见的文档。我们强调了计算效率与语义准确性之间的关键权衡,为RAG从业者在生产环境中选择OCR依赖式与基于视觉的文档检索系统提供了实用指导。

关键词

引用

@article{arxiv.2505.05666,
  title  = {Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval},
  author = {Alexander Most and Joseph Winjum and Ayan Biswas and Shawn Jones and Nishath Rajiv Ranasinghe and Dan O'Malley and Manish Bhattarai},
  journal= {arXiv preprint arXiv:2505.05666},
  year   = {2025}
}