中文

TABLET:用于鲁�视表格理解的大规模数据集

计算机视觉与模式识别 2026-02-13 v3 计算与语言

摘要

虽然表格理解越来越依赖像级方法,但当前基准主要使用合成渲染,缺乏真实世界表格的复杂性和视觉多样性。此外,现有的视觉表格理解(VTU)数据集提供的是固定示例,仅包含单个可视化和预定义指令,无法访问底层序列化数据进行重新表述。我们引入TABLET,一个规模庞大的VTU数据集,包含400万个示例,覆盖21个任务,基于200万个唯一表格,其中88%保留了原始可视化。为评估模型是否能够联合推理表格和视觉内容,我们还引入了VisualTableQA,一个需要视觉感知和表格理解的基准。对Qwen2.5-VL-7B和Gemma 3-4B等视觉语言模型在TABLET上进行微调,能在看见和未看见的VTU任务上提高性能,同时在真实世界表格可视化上提高鲁棒性。通过保留原始可视化并在统一的大规模集合中维护示例可追溯性,TABLET为鲁健的训练和可扩展的评估奠定了基础。

关键词

引用

@article{arxiv.2509.21205,
  title  = {TABLET: A Large-Scale Dataset for Robust Visual Table Understanding},
  author = {Iñigo Alonso and Imanol Miranda and Eneko Agirre and Mirella Lapata},
  journal= {arXiv preprint arXiv:2509.21205},
  year   = {2026}
}