SCORE:面向生成式文档解析的语义评估框架
计算与语言
2025-09-25 v1 人工智能
摘要
多模态生成式文档解析系统对传统评估提出了挑战:与确定性的OCR或布局模型不同,它们通常产生语义正确但结构上存在差异的输出。传统指标——CER、WER、IoU或TEDS——将这种多样性误判为错误,惩罚有效的解释并掩盖系统行为。我们引入了SCORE(结构与内容鲁棒评估),这是一个与解释无关的框架,它整合了:(i) 用于鲁棒内容保真度的调整编辑距离,(ii) 用于区分幻觉与遗漏的词例级诊断,(iii) 具有空间容忍度和语义对齐的表格评估,以及 (iv) 层次结构感知的一致性检查。这些维度共同实现了在拥抱表示多样性的同时强制执行语义严谨性的评估。在涵盖一个整体基准数据集和一个领域数据集的1,114个页面上,SCORE一致地揭示了标准指标所遗漏的跨数据集性能模式。在2-5%具有模糊表格结构的页面中,传统指标平均对系统的惩罚高达12-25%,导致排名失真。SCORE纠正了这些情况,恢复了备选但有效解释之间的等价性。此外,通过将生成式输出规范化为一种与格式无关的表示,SCORE复现了传统分数(例如,表格F1高达0.93),而无需目标检测流程,这表明仅靠生成式解析就足以进行全面评估。通过揭示解释性差异如何影响评估结果并提供多维、可解释的诊断,SCORE为现代文档解析系统建立了基于语义的、公平且实用的基准测试基本原则。
引用
@article{arxiv.2509.19345,
title = {SCORE: A Semantic Evaluation Framework for Generative Document Parsing},
author = {Renyu Li and Antonio Jimeno Yepes and Yao You and Kamil Pluciński and Maximilian Operlejn and Crag Wolfe},
journal= {arXiv preprint arXiv:2509.19345},
year = {2025}
}