中文

DOCR-Inspector:基于 VLM 的文档解析细粒度自动评估

计算机视觉与模式识别 2025-12-12 v1

摘要

文档解析旨在将非结构化 PDF 图像转换为半结构化数据,以促进信息在各个领域的数字化和利用。虽然视觉语言模型(VLM)在此任务方面取得了显著进展,但在实际场景中实现可靠、高质量的解析仍具有挑战性。常见做法通常选择标准基准上表现最好的模型。然而,这些基准可能携带数据集特定偏差,导致模型排名不一致且与实际性能关联性有限。此外,基准指标通常仅提供整体得分,这可能会掩盖输出中不同错误模式。这引出一个关键挑战:我们如何可靠且全面地在野外评估文档解析质量?我们提出了 DOCR-Inspector,通过细粒度错误检测和分析来形式化文档解析评估。利用 VLM 作为评判者,DOCR-Inspector 分析文档图像及其解析输出,识别所有错误,分配到 28 个预定义类型中,并生成综合质量评估。为实现此功能,我们构建了 DOCRcase-200K 用于训练,并提出了 Chain-of-Checklist 推理范式以实现解析质量评估的层次结构。为进行经验验证,我们引入了 DOCRcaseBench,这是一套 882 个真实世界文档解析案例,包含人工标注。在该基准上,DOCR-Inspector-7B 在准确率和质量评估方面超过了像 Gemini 2.5 Pro 这样的商业模型以及领先的开源模型。进一步实验表明,其质量评估为解析结果的细化提供了有价值的指导,使 DOCR-Inspector 既是实用的评估器,也是推动文档解析系统大规模发展的驱动力。模型和代码已发布:https://github.com/ZZZZZQT/DOCR-Inspector。

关键词

引用

@article{arxiv.2512.10619,
  title  = {DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM},
  author = {Qintong Zhang and Junyuan Zhang and Zhifei Ren and Linke Ouyang and Zichen Wen and Junbo Niu and Yuan Qu and Bin Wang and Ka-Ho Chow and Conghui He and Wentao Zhang},
  journal= {arXiv preprint arXiv:2512.10619},
  year   = {2025}
}