中文

从学术 PDF 文档中提取正文用于文本挖掘

信息检索 2020-10-27 v1

摘要

从 PDF 格式学术文档中准确提取正文,对于实现更深语义理解的文本挖掘应用至关重要。目标是将正文中的完整句子按原始句子流与段落边界提取至 txt 文件。现有 PDF 文本提取工具常混淆正文与非正文文本。我们设计并实现名为 PDFBoT 的系统,采用线扫描技术检测多栏版式,在反向遍历中利用计算文本特征与句法标注去除非正文文本,并将剩余文本重新对齐至句子与段落。结果表明,在从 arXiv.org 跨多个学科随机选取的 PDF 文档语料上,PDFBoT 提取句子、提取段落及去除表格/图/表中文本的平均 F1 分数分别为 0.99、0.96 与 0.98,准确度极高。

关键词

引用

@article{arxiv.2010.12647,
  title  = {Extracting Body Text from Academic PDF Documents for Text Mining},
  author = {Changfeng Yu and Cheng Zhang and Jie Wang},
  journal= {arXiv preprint arXiv:2010.12647},
  year   = {2020}
}

备注

8 pages, 2 figures