DocPTBench:面向摄影文档解析与翻译的基准测试
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
多模态大语言模型(MLLMs)的出现解放了文档解析与翻译的端到端潜力。然而,现有基准如 OmniDocBench 和 DITrans 主要由完好扫描文档或数字文档组成,无法充分代表现实捕获条件下的复杂挑战,如几何畸变和光照变化。为填补这一空白,我们提出 DocPTBench,一个专为摄影文档解析与翻译设计的全面基准测试。DocPTBench 包含来自多个领域的超过 1,300 份高分辨率摄影文档,涵盖八种翻译场景,并为解析和翻译提供严格的人工验证标注。我们的实验表明,从数字文档转向摄影文档会导致性能显著下降:流行的 MLLMs 在端到端解析中准确率下降约 18%,在翻译中下降约 12%,而专用文档解析模型显示出约 25% 的平均性能下降。这一显著的性能差距凸显了现实捕获条件下文档所面临的独特挑战,揭示了现有模型鲁棒性不足的现实。数据集和代码已公开于 https://github.com/Topdu/DocPTBench。
引用
@article{arxiv.2511.18434,
title = {DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation},
author = {Yongkun Du and Pinxuan Chen and Xuye Ying and Zhineng Chen},
journal= {arXiv preprint arXiv:2511.18434},
year = {2025}
}