RaV-IDP:面向可靠智能文档处理的重建即验证框架
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
智能文档处理管道从文档中提取结构化实体(表格、图像和文本),供知识库、检索增强生成和分析等下游系统使用。现有管道的一个持久性限制是:提取输出缺乏内在机制验证其是否忠实地代表源文档。模型内部的置信度评分衡量的是推理确定性,而非与文档的对应性,提取错误会悄然传递到下游消费者。我们提出了“重建即验证”(RaV-IDP),一个引入重建作为一级架构组件的文档处理管道。每个实体被提取后,专用的重建器将提取的表示重新渲染为可与原始文档区域进行比较的形式,比较器对重建与未修改的源块之间的忠实度进行评分。该忠实度得分是一种基于标签的质量信号。当忠实度低于每个实体类型的阈值时,将触发结构化的 GPT-4.1 视觉后备方案,验证循环重复进行。我们强制执行一个引导约束:比较器始终以原始文档区域为锚点,而非以提取内容为锚点,以防止验证过程产生循环。我们进一步提出了每个阶段评估框架,将每个管道组件与相应的基准测试配对。代码管道已公开于 https://github.com/pritesh-2711/RaV-IDP,供实验和使用。
引用
@article{arxiv.2604.23644,
title = {RaV-IDP: A Reconstruction-as-Validation Framework for Faithful Intelligent Document Processing},
author = {Pritesh Jha},
journal= {arXiv preprint arXiv:2604.23644},
year = {2026}
}