中文

文档解析器会如何失效? auditing 文档智能中的结构漂洞

计算与语言 2026-05-27 v2

摘要

文档布局分析 (DLA) 流程为检索增强生成、长文档问答等文档智能系统提供结构化页面表示,但其鲁棒性评估仍主要以面积为中心。我们识别了这一足迹偏差 (Footprint Bias),并提出了 ProSA 框架,这是一个轻量级的输出级审计框架,解耦受控探针、策略驱动的目标定位和结构感知的诊断。ProSA 结合块级结构损失率 (B-SLR)、粒度感知的曝露描述符以及路径归因,分析结构身份丢失的确切位置、失效何时出现以及失效如何传播。在 MinerU 和 PP-StructureV3 上进行 1000 页的测试中,受影响面积与扰动引起的 OCR 不稳定性之间的关联较弱 (R^2=0.384/0.110),而 B-SLR 与之关联更紧密 (R^2=0.727/0.916)。曝露描述符进一步区分遮挡和拓扑主导的路径,而匹配足迹的结构探针导致的下游 QA/检索性能下降显著超过面积匹配的擦除。这些结果将 DLA 鲁棒性评估从基于足迹的压力测试,转向结构感知的漏洞审计。

关键词

引用

@article{arxiv.2605.19309,
  title  = {How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence},
  author = {Yue Chen and Yihao Wang and Ziyi Tang and Yongsen Zheng and Keze Wang},
  journal= {arXiv preprint arXiv:2605.19309},
  year   = {2026}
}

备注

18 pages, 5 figures, preprint