野生表格基准 (WildTableBench):面向野外表格理解的数据集
计算机视觉与模式识别
2026-05-25 v2
摘要
使用多模态基础模型分析表格图像是消费和企业场景中高价值且具挑战性的应用。尽管其重要性明确,但当前的评估主要依赖结构化文本表格或干净渲染图像,野外表格图像的视觉复杂度尚未得到充分探讨。此类图像具有多样化的布局和多元化的领域,要求模型具备 sophisticated 的结构感知和数值推理能力。为弥合这一差距,我们提出WildTableBench——首个针对来自真实场景中自然发生表格图像的问答基准测试。WildTableBench 包含 402 张高信息密度表格图像,来源于网络论坛和网站,覆盖多个领域;并附带 928 项手动标注并验证的问题,这些问题涵盖 17 种子类型,分为 5 大类。我们在此基准上评估了 21 个前沿的专有和开源多模态基础模型。只有一个模型超过 50% 的准确率,其余模型的准确率范围为 4.1% 至 49.9%。我们进一步进行诊断性分析,以刻画模型的失败模式,揭示结构感知和推理方面存在持久性弱点。这些结果和分析为当前模型能力提供了有价值的见解,并将WildTableBench 确立为诊断表格图像理解的宝贵基准。数据集:https://huggingface.co/datasets/jzhuang/WildTableBench 代码:https://github.com/hjzhe/WildTableBench 排行榜:https://hjzhe.github.io/WildTableBench
引用
@article{arxiv.2605.01018,
title = {WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild},
author = {Junzhe Huang and Xiaoxiao Sun and Yan Yang and Yuxuan Hou and Ruotian Zhang and Sirui Li and Hehe Fan and Serena Yeung-Levy and Xin Yu},
journal= {arXiv preprint arXiv:2605.01018},
year = {2026}
}