AgenticOCR:用于高效检索增强生成的按需解析 OCR
计算机视觉与模式识别
2026-03-02 v1 计算与语言
摘要
检索增强生成 (RAG) 向多模态领域的扩展加剧了处理复杂视觉文档(如财务报告)的挑战。虽然基于页面级别的分块和检索是自然的起点,但它会创建一个关键瓶颈:将整个页面递送给生成器会引入过多的冗余上下文。这不仅会超载生成器的注意力机制,还会稀释最突出的证据。此外,将这些信息丰富的页面压缩到有限的视觉 token 预算中进一步增加了幻觉的风险。为此,我们引入了 AgenticOCR,一种动态解析范式,将光学字符识别 (OCR) 从静态的全文本过程转化为查询驱动的按需提取系统。通过以“图像内思考”的方式自主分析文档布局,AgenticOCR 识别并选择性地识别感兴趣的区域。该方法在所需位置实现了视觉 token 的按需解压,有效地将检索粒度与僵化的页面级别分块相解耦。AgenticOCR 有望作为视觉文档 RAG 堆栈的“第三个建设模块”,与标准的嵌入和重排序模块一起工作并提升效果。实验结果表明,AgenticOCR 在提高视觉 RAG 系统的效率和准确性方面取得了显著效果,在长文档理解方面实现了专家水平的性能。代码和模型已提供于 https://github.com/OpenDataLab/AgenticOCR。
引用
@article{arxiv.2602.24134,
title = {AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation},
author = {Zhengren Wang and Dongsheng Ma and Huaping Zhong and Jiayu Li and Wentao Zhang and Bin Wang and Conghui He},
journal= {arXiv preprint arXiv:2602.24134},
year = {2026}
}