中文

野生文档:我们离实现野外全面且稳健的文档理解有多远?

计算机视觉与模式识别 2025-05-28 v2

摘要

多模态大型语言模型(MLLM)的快速进步显著提升了文档理解能力。然而,主流基准如 DocVQA 和 ChartQA 主要包含扫描或数字文档,无法充分反映诸如光照变化和物理失真等多样化现实场景所带来的复杂挑战。本文引入 WildDoc,首个专为评估自然环境下文档理解而设计的基准。WildDoc 包含多样化的手动捕获文档图像,反映真实场景条件,并利用来自既有基准的数据源,以便对数字或扫描文档进行全面比较。进一步地,为严格评估模型鲁棒性,每份文档在不同条件下进行四次捕获。对 WildDoc 上领先 MLLM 的评估暴露了显著的性能下降,凸显了相较于传统基准,模型在鲁棒性方面的不足,凸显了现实文档理解所面临的独特挑战。我们的项目主页地址为 https://bytedance.github.io/WildDoc。

关键词

引用

@article{arxiv.2505.11015,
  title  = {WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?},
  author = {An-Lan Wang and Jingqun Tang and Liao Lei and Hao Feng and Qi Liu and Xiang Fei and Jinghui Lu and Han Wang and Weiwei Liu and Hao Liu and Yuliang Liu and Xiang Bai and Can Huang},
  journal= {arXiv preprint arXiv:2505.11015},
  year   = {2025}
}