中文

PDF 解析工具在不同文档类别中的比较研究

信息检索 2025-04-04 v2 数字图书馆

摘要

PDF 是最突出的数据格式之一,PDF 解析对于信息提取和检索至关重要,尤其是在 RAG 系统兴起之后。虽然存在各种 PDF 解析工具,但其在不同文档类型上的有效性仍未得到充分研究,尤其是超出学术论文之外的范围。我们的研究旨在弥补这一差距,通过在 DocLayNet 数据集上比较 10 个流行的 PDF 解析工具,涵盖 6 个文档类别。这些工具包括 PyPDF、pdfminer-six、PyMuPDF、pdfplumber、pypdfium2、Unstructured、Tabula、Camelot,以及基于深度学习的工具 Nougat 和 Table Transformer(TATR)。我们评估了文本提取和表格检测能力。对于文本提取,PyMuPDF 和 pypdfium 总体上优于其他工具,但所有解析器在科学文献和专利文档方面都表现不佳。在这些具挑战性的类别中,基于学习的工具如 Nougat 显示出优异性能。在表格检测方面,TATR 在金融、专利、法律法规和科学类别中表现突出。表格检测工具 Camelot 在招标文件中表现最佳,而 PyMuPDF 在操作手册类别中表现更佳。我们的发现突显了根据文档类型和特定任务选择合适解析工具的重要性,为从事多样化文档来源研究和实践者提供了宝贵的见解。

关键词

引用

@article{arxiv.2410.09871,
  title  = {A Comparative Study of PDF Parsing Tools Across Diverse Document Categories},
  author = {Narayan S. Adhikari and Shradha Agarwal},
  journal= {arXiv preprint arXiv:2410.09871},
  year   = {2025}
}

备注

17 pages,11 figures, 5 tables