PubTables-v2:用于全页与多页表格提取的新大规模数据集
计算机视觉与模式识别
2026-03-19 v2
摘要
表格提取(TE)是视觉文档理解中的一项关键挑战。传统方法首先检测表格,然后识别其结构。最近,人们对开发能够直接在其全页或文档上下文中提取表格的方法(如视觉语言模型(VLMs))的兴趣激增。然而,由于缺乏标注数据,进展难以展现。为了解决这一问题,我们创建了一个新的大规模数据集 PubTables-v2。PubTables-v2 支持多项具有挑战性的表格提取任务。值得注意的是,它是首个用于多页表格结构识别的大规模基准。我们评估了几个较小的专用 VLMs,以在这些任务上建立基线性能。正如我们所展示的,多页表格识别是当前模型能力的一个关键缺口。有趣的是,我们表明引入一个预测何时跨页合并表格的图像分类器可以显著提高性能。数据、代码和模型将在 https://huggingface.co/datasets/kensho/PubTables-v2 发布。
引用
@article{arxiv.2512.10888,
title = {PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction},
author = {Brandon Smock and Valerie Faucon-Morin and Max Sokolov and Libin Liang and Tayyibah Khanam and Amrit Ramesh and Maury Courtland},
journal= {arXiv preprint arXiv:2512.10888},
year = {2026}
}
备注
30 pages, added more experiments