中文

MDPBench:用于多语言文档解析的基准

计算机视觉与模式识别 2026-03-31 v1 人工智能

摘要

我们介绍了多语言文档解析基准(Multilingual Document Parsing Benchmark),这是第一个面向多语言数字文档和拍照文档的基准。文档解析取得了显著进展,但几乎仅限于干净、数字、格式良好的页面,且仅针对少数主导语言。目前尚无系统性基准用于评估模型在跨越多种脚本和低资源语言的数字文档和拍照文档上的性能。MDPBench包含3400个文档图像,涵盖17种语言、多种脚本以及多种拍照条件,并通过专家模型标注、人工校正和人类验证严格管控质量。为确保公平比较并防止数据泄漏,我们维护了独立的公共评估和私人评估分割。我们全面评估了开源和闭源模型,发现惊人的发现:尽管闭源模型(尤其是Gemini3-Pro)在各类场景下相对稳健,但开源方案在非拉丁脚本和真实场景拍照文档上表现显著崩溃,拍照文档平均下降17.8%,非拉丁脚本下降14.0%。这些结果揭示了语言和情境之间的显著性能不平衡,指向构建更包容、部署就绪解析系统的具体方向。源码可在https://github.com/Yuliang-Liu/MultimodalOCR获取。

关键词

引用

@article{arxiv.2603.28130,
  title  = {MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios},
  author = {Zhang Li and Zhibo Lin and Qiang Liu and Ziyang Zhang and Shuo Zhang and Zidun Guo and Jiajun Song and Jiarui Zhang and Xiang Bai and Yuliang Liu},
  journal= {arXiv preprint arXiv:2603.28130},
  year   = {2026}
}