中文

PdfTable:面向深度学习的统一表格提取工具包

计算机视觉与模式识别 2024-09-10 v1

摘要

当前,大量文档数据以非结构化格式存在,包括便携式文档格式(PDF)文件和图像。从这些文档中提取信息面临着诸多挑战,包括多样化的表格样式、复杂的表单以及不同语言的包含。已 developed several open-source toolkits,如 Camelot、Plumb a PDF(pdfnumber)和 Paddle Paddle Structure V2(PP-StructureV2),以便于从 PDF 或图像中提取表格。然而,每个工具包都有其局限性。Camelot 和 pdfnumber 只能提取数字 PDF 中的表格,无法处理图像-based PDF 和图片。另一方面,PP-StructureV2 可以全面提取图像-based PDF 和图片中的表格,但缺乏区分不同应用场景的能力,如有线表格和无线表格、数字 PDF 和图像 PDF。为此,我们引入了 PDF 表格提取(PdfTable)工具包。该工具包集成了众多开源模型,包括七个表格识别模型、四个光学字符识别(OCR)识别工具和三个布局分析模型。通过优化 PDF 表格提取流程,PdfTable 在各种应用场景下都具有适应性。我们通过在自标注的有线表格数据集和开源无线 Publicly Table Reconition Dataset(PubTabNet)上的验证,证明了 PdfTable 工具包的有效性。PdfTable 代码将在 Github 上发布:https://github.com/CycloneBoy/pdf_table。

关键词

引用

@article{arxiv.2409.05125,
  title  = {PdfTable: A Unified Toolkit for Deep Learning-Based Table Extraction},
  author = {Lei Sheng and Shuai-Shuai Xu},
  journal= {arXiv preprint arXiv:2409.05125},
  year   = {2024}
}

备注

19 pages, 4 figures