中文

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

计算机视觉与模式识别 2026-04-28 v1 计算与语言

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)在视觉丰富文档理解(VRDU)任务中取得了显著的性能,但其能力主要在干净、结构良好的文档图像上进行评估。我们关注来自碎片化片段的内容恢复,这是一种需要在显著内容中断情况下将视觉模式识别与语义推理集成的具有挑战性的VRDU设置。为系统评估复杂的VRDU任务,本文引入ShredBench,由自动化生成管道支持,该管道直接从Markdown渲染碎片化文档。该提议管道通过允许灵活集成最新或未被使用的文本来源以防止训练数据污染,确保评估的有效性。ShredBench在四种场景(英文、中文、代码、表格)以及三种碎片化粒度(8、12、16片)下进行评估。对当前最先进MLLMs的经验评估显示出显著的性能差距:该方法在完整文档上效果良好;然而,一旦文档被碎片化,恢复工作就成为一个挑战,随着碎片化程度的增加,NED(Normalized Edit Distance)急剧下降。我们的发现表明,当前MLLMs缺乏将视觉中断桥接起来的细粒度跨模态推理能力,揭示了稳健VRDU研究中的关键缺口。

关键词

引用

@article{arxiv.2604.23813,
  title  = {ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction},
  author = {Zichun Guo and Yuling Shi and Wenhao Zeng and Chao Hu and Haotian Lin and Terry Yue Zhuo and Jiawei Chen and Xiaodong Gu and Wenping Ma},
  journal= {arXiv preprint arXiv:2604.23813},
  year   = {2026}
}

备注

ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench