PubTables-1M:面向非结构化文档的表格全面提取
机器学习
2021-11-22 v3 计算机视觉与模式识别
摘要
近年来,将机器学习应用于非结构化文档中表格结构推断与提取问题取得了显著进展。然而,最大的挑战之一仍是在大规模下创建完整、无歧义的 ground truth 数据集。为此,我们开发了一个名为 PubTables-1M 的更全面的表格提取数据集。PubTables-1M 包含来自科学论文的近一百万个表格,支持多种输入模态,并包含表格结构的详细表头与位置信息,使其适用于多种建模方法。它还通过一种新颖的规范化流程,解决了先前数据集中观察到的称为过度分割的 ground truth 不一致的重要来源。我们证明这些改进显著提升了训练性能,并为表格结构识别的评估提供了更可靠的模型性能估计。此外,我们表明在 PubTables-1M 上训练的基于 transformer 的目标检测模型在检测、结构识别和功能分析这三项任务上均取得了优异结果,且无需针对这些任务进行任何特殊定制。数据和代码将在 https://github.com/microsoft/table-transformer 发布。
引用
@article{arxiv.2110.00061,
title = {PubTables-1M: Towards comprehensive table extraction from unstructured documents},
author = {Brandon Smock and Rohith Pesala and Robin Abraham},
journal= {arXiv preprint arXiv:2110.00061},
year = {2021}
}